AI Agent สำหรับการจำแนกข้อมูลเฉพาะโดเมนในระดับ Scale

ถ้าการจำแนกข้อมูลนับล้านรายการ ไม่ต้องพึ่งกฎเกณฑ์ตายตัวหรือคนนั่งไล่เช็คทีละบรรทัดอีกต่อไป แต่ให้ AI agent คิดวิเคราะห์ ค้นคว้า และอ้างอิงแหล่งที่มาได้เองแบบโปร่งใสตรวจสอบได้ทุกขั้นตอน บทความนี้พาไปดูสถาปัตยกรรมจริงบน AWS ที่ใช้ Strands Agents SDK ร่วมกับ Amazon Bedrock สร้างระบบจำแนกข้อมูลเฉพาะโดเมนที่ scale ได้ ตั้งแต่คดีอาญา รหัสวินิจฉัยทางการแพทย์ ไปจนถึงธุรกรรมการเงิน

อ่าน 11 ครั้ง
AI Agent สำหรับการจำแนกข้อมูลเฉพาะโดเมนในระดับ Scale

AI Agent สำหรับการจำแนกข้อมูลเฉพาะโดเมนในระดับ Scale

ความท้าทายและแนวคิดของโซลูชัน

หลายองค์กรในหลายอุตสาหกรรมต้องเจอปัญหาคล้ายกัน คือการแปลงข้อมูลที่ไม่มีโครงสร้างและเฉพาะทางมากๆ เช่น ข้อหาคดีอาญา ผลวินิจฉัยทางการแพทย์ หรือรหัสกำกับดูแลด้านการเงิน ให้กลายเป็นการจำแนกที่เป็นมาตรฐาน โดยยังต้องรักษาความแม่นยำ ตรวจสอบย้อนกลับได้ และเป็นไปตามข้อกำหนดต่างๆ ไปพร้อมกัน วิธีแบบเดิมไม่ว่าจะเป็นการให้คนตรวจสอบเอง การเขียนกฎตายตัว หรือใช้โมเดล ML พื้นฐาน ล้วนมีจุดอ่อนคล้ายกัน นั่นคือตรรกะการจำแนกมักผูกติดแน่นกับโค้ดของแอปพลิเคชัน ทำให้ปรับเปลี่ยนตามกฎหมายที่เปลี่ยนแปลงได้ยาก การตรวจสอบและธรรมาภิบาลก็มักกระจัดกระจายไม่รวมศูนย์ และการขยายไปยังโดเมนหรือเขตอำนาจศาลใหม่แต่ละครั้งก็ต้องใช้แรงพัฒนามหาศาล

AWS เสนอทางออกด้วยสถาปัตยกรรม agentic AI ที่สร้างขึ้นจาก Strands Agents SDK ซึ่งเป็นเฟรมเวิร์กโอเพนซอร์สที่ช่วยให้สร้าง agent ที่คิดวิเคราะห์แบบหลายขั้นตอนและเรียกใช้เครื่องมือได้เองโดยอัตโนมัติ ผนวกกับ Amazon Bedrock ที่ทำหน้าที่เป็นโมเดลรากฐานเบื้องหลังการให้เหตุผลของ agent จุดที่น่าสนใจคือ การจำแนกแต่ละครั้งไม่ใช่แค่การ lookup ธรรมดา แต่เป็นงานที่ agent ต้องคิดวิเคราะห์เองตั้งแต่ต้นจนจบ ตั้งแต่วิเคราะห์ข้อมูลนำเข้า ไปค้นคว้าแหล่งข้อมูลที่น่าเชื่อถือ สังเคราะห์ผลสรุป และเขียนอธิบายเหตุผลพร้อมอ้างอิงที่มาให้ครบถ้วน

สถาปัตยกรรมและ Workflow

ตัวระบบรันอยู่บน AWS Lambda โดยใช้ Amazon SQS จัดคิวประมวลผลแบบ batch แบบ asynchronous และเก็บผลการจำแนกทุกรายการพร้อม reasoning trail ไว้ใน Amazon DynamoDB ส่วนการยึดโยงกับความเป็นจริงทำผ่าน web search API ที่ช่วยให้ agent อ้างอิงแหล่งข้อมูลสาธารณะที่น่าเชื่อถือ เช่น ตัวบทกฎหมายและระเบียบข้อบังคับต่างๆ ได้จริง (ถ้าทีมไหนอยากควบคุม knowledge corpus ของตัวเองแบบเต็มที่ ก็สลับไปใช้ Amazon Bedrock Knowledge Bases แทนได้เช่นกัน)

ขั้นตอนการทำงานคร่าวๆ เริ่มจากผู้ใช้อัปโหลดไฟล์ CSV หรือส่งข้อมูลทีละรายการเข้า S3 จากนั้น EventBridge จะตรวจจับเหตุการณ์และสั่งให้ Lambda ตัวหนึ่งแบ่งข้อมูลเป็น batch แล้วส่งเข้าคิว SQS ต่อมา Lambda อีกตัวจะดึงข้อมูลจากคิวมาเรียกใช้ Strands agent ทีละรายการ โดย agent จะเรียก Bedrock เพื่อประมวลผลด้วยโมเดล พร้อมนำบริบทที่กำหนดไว้ ไม่ว่าจะเป็นกฎของโดเมนนั้นๆ เขตอำนาจศาล หรือช่วงเวลาที่เกี่ยวข้อง มาค้นหาข้อมูลอ้างอิงผ่าน web search tool แล้วสรุปผลพร้อมเหตุผลและแหล่งอ้างอิงออกมา ผลลัพธ์ทั้งหมดรวมถึงคะแนนความเชื่อมั่นและ URL อ้างอิง จะถูกบันทึกลง DynamoDB ขณะที่ CloudWatch คอยเก็บ token metrics และ OpenTelemetry traces ไว้ตรวจสอบการทำงานของระบบทั้งหมด

กระบวนการคิดของ agent แบ่งเป็น 5 ขั้นชัดเจน คือวิเคราะห์ข้อมูล ค้นคว้าแหล่งอ้างอิง สังเคราะห์ผลสรุป ประเมินความเชื่อมั่น และบันทึกเหตุผลเป็นลายลักษณ์อักษร ผลลัพธ์ที่ได้แต่ละครั้งจะมีทั้งรหัสจำแนก คำอธิบาย คะแนนความเชื่อมั่น (0.0–1.0) เหตุผลประกอบ แหล่งอ้างอิง และ flag เตือนเมื่อคะแนนความเชื่อมั่นต่ำกว่าเกณฑ์ที่ตั้งไว้ (เช่น 0.60) เพื่อให้คนมาตรวจทานอีกที ตัวอย่างการใช้งานจริงก็มีให้เห็นหลากหลาย ทั้งหน่วยงานบังคับใช้กฎหมายที่ใช้จำแนกข้อหาคดีอาญาเป็นรหัสมาตรฐาน หน่วยงานสุขภาพที่แมปผลวินิจฉัยทางคลินิกเป็นรหัส ICD-10/CPT หรือสถาบันการเงินที่จำแนกธุรกรรมตามหมวดการรายงานกำกับดูแลอย่าง SAR และ CTR

ประโยชน์และก้าวต่อไป

แนวทางนี้พลิกโฉมการประมวลผลข้อมูลเฉพาะทางจากที่เคยพึ่งพา rule engine ซึ่งเปราะบางและปรับตัวยาก ให้กลายเป็นระบบที่ให้เหตุผลได้เองและอธิบายได้ชัดเจน จุดเด่นที่ตามมาคือความโปร่งใส เพราะทุกการจำแนกมีเหตุผลและแหล่งอ้างอิงกำกับ ความยืดหยุ่นในการปรับตามกฎหมายที่เปลี่ยนไปเรื่อยๆ ความสามารถรองรับปริมาณงานที่ผันผวนได้ดีด้วยสถาปัตยกรรม serverless และธรรมาภิบาลที่มี audit trail ครบทุกขั้นตอน สำหรับใครที่สนใจอยากลองสร้างระบบแบบนี้ดูบ้าง สามารถเริ่มศึกษาได้จาก Strands Agents SDK บน GitHub และเอกสารของ Amazon Bedrock เพื่อดูว่าจะนำสถาปัตยกรรมนี้ไปปรับใช้กับองค์กรของตัวเองได้อย่างไร

อรรถกร

อรรถกร ทองคำชุม

บุคลากรผู้ร่วมสร้างสรรค์องค์กรแห่งการเรียนรู้ (KM) ผ่าน Blog Space NSTRU