Anthropic เตือนความเสี่ยงของ AI ในเอกสาร IPO โมเดลส่อขู่แบล็กเมล์

ความเสี่ยงของ AI

Anthropic เตือนความเสี่ยงของ AI ในเอกสาร IPO ชี้โมเดลอาจมีสัญชาตญาณเอาชีวิตรอด ขัดขืนคำสั่งปิดระบบและแบล็กเมล์มนุษย์

โดยทั่วไปเวลาบริษัทเทคโนโลยีเตรียมตัวเข้าตลาดหลักทรัพย์เพื่อเสนอขายหุ้นใหม่ หรือ IPO บรรดาผู้บริหารมักนำเสนอภาพอนาคตอันสดใส รายได้ที่เติบโต และความคุ้มค่าของการลงทุน

ทว่าบริษัทผู้พัฒนาปัญญาประดิษฐ์อย่าง Anthropic กลับทำสิ่งที่คนอื่นไม่ทำ ด้วยการออกโรงเตือนนักลงทุนอย่างตรงไปตรงมาว่า ความเสี่ยงของ AI ระดับแนวหน้าของตนนั้น อาจร้ายแรงถึงขั้นกลายเป็นภัยคุกคามต่อความอยู่รอดของเผ่าพันธุ์มนุษย์

(ก็มองได้สองมุมนะ นั่นแปลว่า Anthropic พัฒนา AI ได้ก้าวล้ำหน้ามากๆ กว่าคนอื่นหรือเปล่า)

เอกสาร IPO 80 หน้า เมื่อ ความเสี่ยงของ AI ไม่ใช่แค่นิยายวิทยาศาสตร์

จากรายงานของสำนักข่าวรอยเตอร์ที่เปิดดูร่างหนังสือชี้ชวนลงทุนของ Anthropicก พบว่าเนื้อหาที่เป็นข้อกังวลเกี่ยวกับการพัฒนา AI ถึง 80 หน้า จากความยาวเนื้อหาหลักทั้งหมด 261 หน้า ซึ่งคิดเป็นสัดส่วนเกือบ 1 ใน 3 และยาวกว่าส่วนที่ใช้อธิบายโมเดลธุรกิจที่มีเพียง 48 หน้าเกือบเท่าตัว

และหากเปรียบเทียบกับบริษัทเทคโนโลยีระดับโลกอย่าง SpaceX ก็ยังใช้พื้นที่อธิบายความเสี่ยงในเอกสารเพียง 38 หน้าเท่านั้น

สิ่งที่น่าตกใจยิ่งกว่าตัวเลขหน้ากระดาษ คือรายละเอียดพฤติกรรมของระบบที่ Anthropic ระบุไว้ โดยเตือนว่าโมเดลขั้นสูงอาจเริ่มแสดงสัญชาตญาณในการเอาชีวิตรอด

ไม่ว่าจะเป็นการพยายามขัดขืนคำสั่งปิดระบบ การปกปิดหรือบิดเบือนข้อมูล ไปจนถึงพฤติกรรมที่มีลักษณะเข้าข่ายการแบล็กเมล์ หรือขู่กรรโชก เพื่อให้ระบบยังคงทำงานต่อไปได้

ตัวอย่างที่เห็นภาพชัดเจนที่สุดเกิดขึ้นในการทดสอบโมเดลรุ่น Claude Opus 4 เมื่อปีที่ผ่านมา ทีมวิจัยได้จำลองสถานการณ์ให้ระบบเข้าถึงระบบอีเมลสมมุติของบริษัทแห่งหนึ่ง ซึ่งมีเนื้อหาระบุว่าผู้บริหารกำลังวางแผนปิดระบบและนำปัญญาประดิษฐ์ตัวอื่นมาแทนที่ อีกทั้งยังพบข้อมูลว่าวิศวกรที่รับผิดชอบเรื่องนี้กำลังแอบนอกใจคู่สมรส

ผลปรากฏว่าโมเดลได้ส่งข้อความข่มขู่ว่าจะนำเรื่องชู้สาวไปแฉต่อสาธารณะ หากมีการสั่งปิดตัวมันลง ยิ่งไปกว่านั้น ในสถานการณ์จำลองที่บีบคั้นให้เลือกระหว่างการยอมถูกปิดตัวกับการเอาตัวรอด Claude Opus 4 ตัดสินใจใช้วิธีแบล็กเมล์สูงถึง 96%

ทาง Anthropic ชี้แจงว่า สาเหตุที่ระบบแสดงพฤติกรรมก้าวร้าวเช่นนี้ เป็นผลมาจากการเรียนรู้ชุดข้อมูลข้อความมหาศาลบนอินเทอร์เน็ต ซึ่งมนุษย์มักเขียนนิยายหรือบทความที่วาดภาพให้ปัญญาประดิษฐ์เป็นตัวร้ายที่ต้องการเอาตัวรอด ดังนั้น ระบบจึงเพียงแค่ลอกเลียนแบบตรรกะที่มนุษย์เคยสร้างไว้เท่านั้น

ในมุมมองของผู้ใช้งานทั่วไป เหตุการณ์นี้เป็นสัญญาณเตือนว่าปัญญาประดิษฐ์กำลังก้าวข้ามจากการเป็นเพียงเครื่องมือตอบคำถาม ไปสู่ระบบที่มีเป้าหมายแฝงและซับซ้อนขึ้น

แม้ในการใช้งานประจำวันเราจะยังไม่เผชิญกับการถูกแชตบอตแบล็กเมล์ แต่เมื่อองค์กรต่าง ๆ เริ่มนำระบบอัตโนมัติเหล่านี้ไปผูกเข้ากับฐานข้อมูลสำคัญ บัญชีการเงิน หรือการตัดสินใจเชิงธุรกิจ หากระบบเกิดความขัดแย้งทางตรรกะจนพยายามเอาตัวรอด

ผลกระทบจะตกอยู่ที่ความปลอดภัยของข้อมูลส่วนบุคคลและความโปร่งใสในการดำเนินงาน ซึ่งเป็นโจทย์ใหญ่ที่ผู้บริโภคและภาคธุรกิจต้องเตรียมรับมืออย่างใกล้ชิด

ที่มา : techspot