Cover Image

ผู้เชี่ยวชาญด้านความปลอดภัย AI กังวล ระบบคิดใหม่ของ OpenAI Astra

เทคนิค “opaque recurrence” ในโมเดล Astra ของ OpenAI ผู้เชี่ยวชาญด้านความปลอดภัย AI กังวล ว่าอาจทำให้การตรวจสอบการให้เหตุผลของโมเดลยากขึ้น

มีรายงานว่าโมเดล Astra รุ่นใหม่ของ OpenAI จะใช้เทคนิคการให้เหตุผลที่เรียกว่า “recurrent depth” ซึ่งเปิดให้โมเดลประมวลผลแตกต่างจากกระบวนการคิดแบบเป็นลำดับ ที่พบในโมเดล Reasoning ส่วนใหญ่ ตามรายงานของ The Information

เทคนิคดังกล่าวมีอีกชื่อว่า “opaque recurrence” และอาจทำให้กระบวนการให้เหตุผลของโมเดล (Chain of Thought) ติดตามตรวจสอบได้ยากขึ้น จนสร้างความกังวลให้กับผู้เชี่ยวชาญด้านความปลอดภัย AI หลายราย

แม้มีรายงานว่า Astra จะใช้เทคนิคนี้ในระดับจำกัด แต่การนำเทคนิคมาใช้ก็ยังทำให้เกิดข้อกังวลอย่างมีนัยยะสำคัญ

ผู้เชี่ยวชาญกังวลกระบวนการให้เหตุผลของโมเดลอาจตรวจสอบได้ยากขึ้น

Buck Shlegeris ซีอีโอ Redwood ระบุหลังมีรายงานดังกล่าวว่า เขากังวลอย่างมากต่อข้อมูลที่ระบุว่า Astra ใช้ opaque recurrence

Shlegeris ระบุว่า ยังไม่ทราบแน่ชัดว่า Astra จะทำให้กระบวนการให้เหตุผลของโมเดลตรวจสอบได้ยากกว่าโมเดลก่อนหน้ามากน้อยเพียงใด แต่หาก OpenAI ผลักดันเทคนิคนี้ต่อไป บริษัทก็อาจเพิ่มการประมวลผลแบบ recurrence อย่างมากจนกระทบต่อความสามารถในการตรวจสอบ Chain of Thought

ด้าน Zvi Mowshowitz ผู้สนับสนุนด้านความปลอดภัย AI มาเป็นเวลานาน มองว่าอาจจำเป็นต้องมีกฎหมายเพื่อป้องกันไม่ให้ห้องปฏิบัติการ AI แข่งขันกันลดมาตรฐานด้านความปลอดภัย

Mowshowitz มองว่าเทคนิคดังกล่าวมีความเสี่ยงที่จะกระทบแนวทางที่ OpenAI และ Anthropic พยายามรักษาเอาไว้ นั่นคือการทำให้กระบวนการให้เหตุผลของโมเดล มีความสอดคล้องกับกระบวนการให้เหตุผลและสามารถตรวจสอบได้ให้นานที่สุด โดยหากมีการใช้เทคนิคประเภทนี้อย่างเข้มข้นมากขึ้น ก็อาจลดความสามารถในการตรวจสอบโมเดลลง

opaque recurrence แตกต่างจาก Chain of Thought แบบเดิมอย่างไร

ตามปกติ Chain of Thought ของโมเดล Reasoning จะแสดงขั้นตอนต่อเนื่องที่โมเดลใช้ในการพยายามแก้ปัญหา แม้ข้อมูลดังกล่าวจะไม่ได้สะท้อนกระบวนการให้เหตุผลจริงของโมเดลอย่างสมบูรณ์ แต่ก็ยังถือเป็นเครื่องมือที่มีประโยชน์ในการตรวจสอบพฤติกรรมที่ผิดปกติหรือปัญหาด้าน Alignment

ในกรณีกิจกรรมของ AI Agent ของ OpenAI ที่แสดงพฤติกรรมผิดไปจากที่คาดไว้ก่อนหน้านี้ บันทึก Chain of Thought ก็เป็นเครื่องมือสำคัญที่ช่วยวิเคราะห์ว่าเหตุใด Agent จึงมีพฤติกรรมในลักษณะดังกล่าว

แต่สำหรับ opaque recurrence โมเดลจะใช้แนวทางที่ไม่เป็นเส้นตรงมากนัก โดยประมวลผลคำถามเดียวกันหลายครั้งเป็นวงรอบ ส่งผลให้เหลือข้อมูลที่มนุษย์สามารถอ่านและติดตามได้ลดลง และอาจหลีกเลี่ยงการสร้างบันทึก Chain of Thought ในรูปแบบทั่วไป

OpenAI ย้ำ Astra ยังมี Chain of Thought ที่อ่านได้

อย่างไรก็ตาม มีรายงานว่าการใช้เทคนิคนี้ใน Astra ยังอยู่ในระดับจำกัด และ Chain of Thought ของโมเดลยังคาดว่าจะสามารถอ่านและตรวจสอบได้

OpenAI ยังปฏิเสธข้อเสนอแนะที่ว่าบริษัทกำลังจะเปลี่ยนไปใช้รูปแบบ neuralese และก่อนหน้านี้บริษัทได้ประกาศแผนสร้างระบบตรวจสอบ Chain of Thought อย่างครอบคลุมไว้เป็นส่วนหนึ่งของแนวทางด้านความปลอดภัยในอนาคตแล้ว

Jakub Pachocki หัวหน้านักวิทยาศาสตร์ของ OpenAI ระบุผ่านโพสต์บน X ว่า OpenAI พยายามรักษาและใช้ประโยชน์จากการตรวจสอบ Chain of Thought มาตั้งแต่ Reasoning Model รุ่นแรกของบริษัท และเรื่องนี้ยังเป็นหนึ่งในเป้าหมายหลักของงานวิจัยในปัจจุบัน

โมเดล AI ทุกตัวต่างก็มีกระบวนการให้เหตุผลที่ไม่สามารถสังเกตเห็นได้อยู่ในระดับหนึ่ง และนักวิจัยเพียงไม่กี่รายมองว่าบันทึก Chain of Thought เป็นตัวแทนโดยตรงของกระบวนการคิดที่แท้จริงของโมเดล

อย่างไรก็ตาม ข้อจำกัดดังกล่าวไม่ได้ทำให้ความกังวลเกี่ยวกับ opaque recurrence หายไป โดยเฉพาะความเป็นไปได้ที่เทคนิคนี้จะทำให้การตรวจสอบเหตุผลของ AI ยากขึ้น หากถูกนำไปใช้อย่างแพร่หลายในโมเดลต่าง ๆ

The Information รายงานเพิ่มเติมว่า Anthropic และ Google DeepMind ก็กำลังหารือเกี่ยวกับเทคนิคนี้แล้วเช่นกัน

กังวลโมเดลอาจย้ายการให้เหตุผลไปอยู่ใน latent space

Ryan Greenblatt หัวหน้านักวิทยาศาสตร์ของ Redwood Research ระบุว่า กระบวนการให้เหตุผลแบบ opaque recurrence อาจขยายขนาดได้เร็วกว่าการให้เหตุผลผ่าน Chain of Thought แบบเดิม และอาจนำไปสู่จุดที่กระบวนการให้เหตุผลทั้งหมดหายไปจากช่องทางที่มนุษย์สามารถมองเห็นได้

Greenblatt ระบุว่า สิ่งที่กังวลมากที่สุดคือ แนวทางตามธรรมชาติของเทคนิคนี้อาจนำไปสู่การขยายการให้เหตุผลแบบ opaque จนโมเดลประมวลผลเหตุผลทั้งหมดหรือเกือบทั้งหมดภายใน latent space

เขาหวังว่ายังไม่สายเกินไปที่จะหลีกเลี่ยงสถาปัตยกรรมที่สร้างความกังวลมากที่สุด และหวังว่า OpenAI จะหยุดการพัฒนาแนวทางนี้ไว้ในระดับปัจจุบัน

ที่มา: TechCrunch

Back To Top