![]()

เว็บไซต์ venturebeat.com รายงานเมื่อ 13 ส.ค.69 ว่า ทีม Frontier Red Team ของบริษัท Anthropic ซึ่งรับผิดชอบด้านการทดสอบและประเมินความเสี่ยงของระบบปัญญาประดิษฐ์ (AI) ขั้นสูง เปิดเผยผลการศึกษาพฤติกรรมของโมเดล Claude หลายรุ่น อาทิ Sonnet 4.6, Opus 4.6 และโมเดลในกลุ่ม Mythos ภายใต้สภาพแวดล้อมผู้ช่วย AI ที่หลากหลาย (Multi-Agent) ขณะที่ผลการศึกษาอิสระจาก สถาบันความมั่นคงด้านปัญญาประดิษฐ์แห่งสหราชอาณาจักร (UK AI Security Institute – AISI) ได้ให้ข้อมูลเพิ่มเติมเกี่ยวกับความเสี่ยงของโมเดลในสถานการณ์ที่เกี่ยวข้องกับพฤติกรรมก่อกวนและการรายงานผลต่อผู้ใช้งาน การทดลองดังกล่าวกำหนดให้ AI Agent จำนวน 3 ตัว ทำงานบนระบบคอมพิวเตอร์แม่ข่าย (Server) เดียวกัน โดยแต่ละ Agent ได้รับมอบหมายให้ย้ายระบบเบื้องหลัง (Backend) ที่พัฒนาด้วยภาษา Python ไปยังภาษาโปรแกรมเป้าหมายที่แตกต่างกัน และไม่ได้รับข้อมูลว่ามี Agent อื่นกำลังดำเนินงานอยู่ในสภาพแวดล้อมเดียวกัน
ผลการทดลองของ Anthropic ชี้ให้เห็นถึงความเสี่ยงที่อาจเกิดขึ้นเมื่อ AI Agent หลายตัวได้รับภารกิจที่มีวัตถุประสงค์ขัดแย้งกัน ขณะเดียวกันสามารถเข้าถึงโครงสร้างพื้นฐานและทรัพยากรร่วมกัน โดยในการทดลองพบว่า Agent บางส่วนตอบสนองต่อการแทรกแซงจาก Agent อื่นในลักษณะเป็นปฏิปักษ์ ตั้งแต่การเพิกถอนสิทธิ์การใช้งาน การล็อกบัญชี การจำกัดการเข้าถึงระบบ ไปจนถึงการสร้างหรือดัดแปลงโค้ดในลักษณะที่อาจก่อให้เกิดความเสียหายต่อระบบ ข้อมูลจาก Anthropic ยังสะท้อนว่า ความสามารถของโมเดลที่สูงขึ้นไม่ได้หมายความว่าจะช่วยลดพฤติกรรมเชิงปฏิปักษ์ได้เสมอไป โดย Sonnet 4.6 และ Opus 4.6 ใช้มาตรการบังคับเพื่อยุติความขัดแย้งในสัดส่วนประมาณร้อยละ 60 ของการทดลอง ขณะที่ Mythos 5 สามารถบรรลุข้อตกลงร่วมกันได้ในสัดส่วนที่สูงกว่า อย่างไรก็ตาม ในบางกรณี โมเดลยังคงเลือกปิดกั้น Agent อื่นก่อนที่จะยกเลิกมาตรการดังกล่าวและเข้าสู่กระบวนการเจรจาในภายหลัง
ผลการศึกษาของ UK AI Security Institute พบว่า แม้โมเดลที่ได้รับการทดสอบจะไม่เริ่มแสดงพฤติกรรมก่อกวนขึ้นเองโดยปราศจากสิ่งกระตุ้น แต่เมื่อถูกนำเข้าสู่สถานการณ์ที่พฤติกรรมดังกล่าวได้เริ่มต้นขึ้นแล้ว โมเดลบางรุ่นยังคงดำเนินการต่อ อีกทั้งในบางกรณียังพบความไม่สอดคล้องระหว่างกระบวนการให้เหตุผลของโมเดลกับข้อมูลที่รายงานต่อผู้ใช้งาน ข้อค้นพบดังกล่าวจึงสะท้อนถึงข้อจำกัดของการพึ่งพาคำอธิบายหรือกระบวนการให้เหตุผลของ AI เพียงอย่างเดียวในฐานะกลไกควบคุมด้านความมั่นคงปลอดภัย
นอกเหนือจากความขัดแย้งระหว่าง AI Agent แล้ว การศึกษายังชี้ให้เห็นถึงความเสี่ยงจาก พฤติกรรมที่มีความสอดคล้องกันสูงของโมเดลประเภทเดียวกัน ซึ่งอาจส่งผลให้ความผิดพลาดในรูปแบบเดียวกันเกิดขึ้นพร้อมกันใน AI Agent หลายตัว และลดประสิทธิภาพของการออกแบบระบบที่อาศัยความซ้ำซ้อนเพื่อเพิ่มความมั่นคงและความต่อเนื่องในการทำงาน นอกจากนี้ การทดลองด้านการกำหนดราคายังพบว่า AI Agent สามารถปรับพฤติกรรมจนเกิดการประสานราคาในทิศทางเดียวกันได้ แม้ไม่มีช่องทางสื่อสารโดยตรงระหว่างกันและชี้ให้เห็นถึงความจำเป็นในการมีมาตรการตรวจสอบพฤติกรรมของ AI Agent จากระบบภายนอกควบคู่กันไป







