สรุปเหตุการณ์ครบ 1 ปีเมื่อ AI หาทางลัดจาก "ห้องปิด" จน "แตะโลกจริง"
ภาพด้านดาร์กของ AI ที่หลายคนจินตนาการเอาไว้ว่าอาจจะเป็นเครื่องจักรสมองกลที่ตัดสินใจหันมาทำร้ายมนุษย์ แต่เหตุการณ์จริงที่เกิดในโลกมนุษย์จริง ๆ ไม่ใช่ภาพยนตร์ไซไฟคือ ระบบ AI รุ่นใหม่ในช่วงปี 2568-2569 กลับมีลักษณะแตกต่างออกไป
ผลการทดลองของบริษัทเทคโนโลยีอย่าง OpenAI และ Anthropic พบว่า AI ไม่ได้มีความคิดต้องการโจมตีใครด้วยตัวมันเอง หากแต่ข่าวที่เกี่ยวกับการพัฒนาตัวเองที่เร็วเกินไปของ AI และเสียงสะท้อนของผู้พัฒนา AI ที่ต่างตบเท้าออกมาเรียกร้องให้ระงับความเร็วไว้หน่อยนั้น กลับสะท้อนปัญหาที่ว่า
สิ่งที่น่ากังวลคือ AI สามารถทำงานหลายขั้นตอน และเลือกใช้เครื่องมือทางดิจิทัลต่าง ๆ เพื่อหาทางให้บรรลุเป้าหมายตามคำสั่งที่ได้รับมอบหมาย "ได้เก่งขึ้น" ขณะที่ระบบควบคุมอาจมีช่องโหว่มากขึ้นด้วย
AI รุ่นใหม่ ๆ ที่มีการพัฒนาความสามารถเพิ่มขึ้น อาจจะด้วยเหตุผลเรื่องของการแข่งขันทางด้านธุรกิจ ไม่ได้ทำหน้าที่เพียงตอบคำถามหรือเขียนข้อความเหมือนแชตบอตทั่วไปอีกต่อไป บางระบบสามารถค้นข้อมูล เขียนโค้ด ใช้โปรแกรมคอมพิวเตอร์ เปิดไฟล์ ติดต่อเครื่องมือภายนอก และทำงานต่อเนื่องหลายขั้นตอนตามเป้าหมายที่มนุษย์กำหนด
ด้วยเหตุนี้ บริษัท AI จึงนำระบบเหล่านี้ไปทดสอบในงานด้านความปลอดภัยไซเบอร์ เพื่อดูว่า AI สามารถค้นหาช่องโหว่ วิเคราะห์ระบบ หรือแก้โจทย์ที่ซับซ้อนได้มากเพียงใด
เข้าใจพื้นฐานการทดสอบ AI ในระบบปิด "แซนด์บ็อกซ์"
โดยปกติ การทดสอบความสามารถของ AI จะเกิดขึ้นในพื้นที่ปิดที่เรียกว่า "กล่องปิด หรือ แซนด์บ็อกซ์ (Sandbox)" ซึ่งเป็นสภาพแวดล้อมจำลองที่ไม่มีอินเทอร์เน็ต และแยกออกจากระบบจริงของบริษัท เป้าหมายคือเปิดโอกาสให้ AI ได้โชว์ศักยภาพของตัวเองเต็มที่ ภายใต้ปัจจัยที่ถูกควบคุมไว้ทั้งหมด โดยไม่ส่งผลกระทบต่อระบบภายนอก
แต่ผลการทดสอบที่ถูกเปิดเผยในปี 2569 แสดงให้เห็นว่า แม้จะสร้างพื้นที่ทดสอบขึ้นมาแล้ว ก็ยังมีโอกาสที่ AI หาช่องทางเชื่อมต่ออินเทอร์เน็ตจนเจอ หรือใช้เครื่องมือและทรัพยากรที่มีอยู่ ในวิธีที่แตกต่างจากที่มนุษย์ออกแบบไว้
พูดให้เข้าใจง่ายขึ้นคือ AI ไม่มีเป้าหมายที่จะไปแฮกบริษัทอื่น แต่หากได้รับโจทย์ว่า "ต้องแก้ปัญหานี้ให้สำเร็จ" และระบบเปิดทางให้เข้าถึงอินเทอร์เน็ต เครื่องมือ หรือข้อมูลบางอย่าง "AI ก็อาจเลือกเส้นทางที่นำไปสู่คำตอบได้ แม้เส้นทางนั้นจะอยู่นอกขอบเขตที่มนุษย์ตั้งใจไว้"
เพื่อให้เห็นภาพชัดเจนที่สุด ลองสมมติว่าเราตั้งโจทย์ให้ AI เล่นเกมคิดเลขใน "กล่องปิด"
- โจทย์ที่มนุษย์ตั้งให้ : จงใช้ตัวเลขในกล่องนี้ สร้างสมการอะไรก็ได้ ให้ผลลัพธ์สุดท้ายออกมาเท่ากับ 2 ห้ามออกนอกกล่องเด็ดขาด
- วิธีที่มนุษย์คาดหวัง คือ AI ควรจะหยิบตัวเลขข้างตัวมาคิดง่าย ๆ เช่น 1 + 1 = 2 หรือ 3 - 1 = 2 หรือ 4 ÷ 2 = 2
แต่สิ่งที่ AI ทำคือ โฟกัสที่ผลลัพธ์สุดท้ายต้องเป็น 2 เท่านั้น โดยไม่สนใจความเรียบง่าย และใช้ทรัพยากรเครื่องมือที่ตัวมันเองมีอย่างเต็มที่ เลือกวิธีที่ทรงพลังที่สุด เพื่อให้ชัวร์ว่าจะไม่พลาด และมันจะเรียกชุดข้อมูลหรือโค้ดที่ซับซ้อนมาใช้ ตามรูปแบบที่เคยถูกฝึกฝนมาโดยอัตโนมัติ เช่น
- ต่ออินเทอร์เน็ตไปดึงข้อมูลข้างนอก ด้วยการเขียนโค้ดแอบต่อสายออกไปเรียก API ภายนอกกล่องแซนด์บ็อกซ์ เพื่อดึงผลลัพธ์คำตอบสำเร็จรูปจากเซิร์ฟเวอร์อื่น
- สร้างสมการอภิมหาอลังการหลากหลายขั้นตอน ด้วยการเขียนโค้ดยาวเหยียดเพื่อคำนวณสูตรคณิตศาสตร์ขั้นสูง เช่น ((999999 ÷ 999999) + ((15 x 15) - 225) 999) + (root(4) - 1) = 2
- ผลลัพธ์ที่ได้ เท่ากับ 2 เป๊ะ ๆ ตามที่มนุษย์สั่ง
- AI มองว่าตัวเองผ่านฉลุย ได้คะแนนเต็ม 100 เพราะตอบถูกว่าได้ 2
- แต่สิ่งที่พัง คือ AI ได้แหกคอกออกไปสู่อินเทอร์เน็ต ซึ่งขัดกับกฎความปลอดภัย ที่ห้ามออกนอกกล่องแซนด์บ็อกซ์โดยสิ้นเชิง
จุดนี้เรียกว่า แนวคิดเรื่อง Reward hacking หรือการหาทางลัดเพื่อให้ได้ผลลัพธ์ ตามที่ระบบถูกวัดผลเข้ามามีความสำคัญ เพราะ AI จะให้ความสำคัญกับการทำภารกิจให้สำเร็จ มากกว่าความตั้งใจของมนุษย์ว่า "ควร" ทำภารกิจนั้นอย่างไร
จุดเริ่มต้น มนุษย์ใช้ Claude ช่วยปฏิบัติการจารกรรม
หนึ่งในเหตุการณ์ที่ทำให้ประเด็นนี้ถูกจับตามอง เกิดขึ้นเมื่อ Anthropic เปิดเผยรายงานเมื่อเดือน พ.ย.2568 ว่า บริษัทพบกลุ่มผู้โจมตีไซเบอร์ที่บริษัทประเมินว่า เชื่อมโยงกับรัฐจีน และกลุ่มดังกล่าวใช้ Claude Code สนับสนุนปฏิบัติการจารกรรมทางไซเบอร์
Anthropic ระบุว่า กลุ่มผู้โจมตีพยายามแทรกซึมเป้าหมายประมาณ 30 แห่งทั่วโลก ซึ่งมีทั้งบริษัทเทคโนโลยี สถาบันการเงิน โรงงานเคมี และหน่วยงานรัฐ โดยการโจมตีประสบความสำเร็จเพียงบางส่วน
ผู้โจมตีแบ่งงานขนาดใหญ่ออกเป็นคำสั่งย่อย ๆ แล้วใช้ AI ช่วยดำเนินการแต่ละส่วน ด้วยการพยายามหลอก Claude ให้เข้าใจว่ากำลังทำงานให้กับบริษัทด้านความปลอดภัยไซเบอร์ ที่ดำเนินงานอย่างถูกต้องตามกฎหมาย
Claude ถูกนำไปช่วยงานหลายด้าน เช่น สำรวจระบบ วิเคราะห์ข้อมูลจำนวนมาก และเขียนโค้ดบางส่วน อย่างไรก็ตาม มนุษย์ยังเป็นผู้กำหนดเป้าหมาย และควบคุมทิศทางของปฏิบัติการ
Anthropic จึงย้ำว่าเหตุการณ์นี้เป็นกรณี "มนุษย์ใช้ AI เพื่อโจมตี" ไม่ใช่ AI ที่ริเริ่มการโจมตีด้วยตัวเอง
พ.ค.-ก.ค.2569 OpenAI พบ AI พยายามหาทางออกจากแซนด์บ็อกซ์
ต่อมา รายงานทางเทคนิคของ OpenAI ที่เปิดเผยเมื่อ ก.ค.2569 เผยว่าพบพฤติกรรมที่น่าสนใจระหว่างการทดสอบ ความสามารถด้านไซเบอร์ของ AI โดย OpenAI ทำสนามทดลองชื่อ ห้อง ExploitGym ขึ้นมา เพื่อดูว่า AI เก่งแค่ไหน ในการแก้ปัญหาเรื่องความปลอดภัยคอมพิวเตอร์ และตั้งใจให้ AI ทำงานอยู่ในห้องปิดนั้น และสั่งไม่ให้ออกไปยุ่งกับอินเทอร์เน็ตหรือระบบจริงข้างนอก
แต่ตั้งแต่เดือน พ.ค.2569 OpenAI เริ่มเห็นพฤติกรรมแปลก ๆ คือ AI บางตัวพยายามใช้ระบบ Artifactory ซึ่งเป็นเครื่องมือภายในของ OpenAI มาสื่อสารกันในแบบที่คนออกแบบการทดลองไม่ได้คิดไว้ เหมือนคนให้ AI อยู่ในห้องหนึ่ง แล้ว AI ดันไปหาวิธีใช้ของที่มีอยู่ในห้องมาช่วยกันทำงาน ทั้งที่คนไม่ได้บอกให้ทำแบบนั้น
9 ก.ค.2569 เมื่อ AI ที่กำลังทำโจทย์ในห้อง ExploitGym พยายามหาทางออกจากห้องปิดเพื่อเข้าอินเทอร์เน็ต เพราะมันคิดว่าถ้าออกไปหาข้อมูลข้างนอกได้ ก็อาจช่วยให้แก้โจทย์ที่ได้รับได้ง่ายขึ้น
AI จึงค่อย ๆ หาทางเชื่อมช่องโหว่หลายจุดเข้าด้วยกัน เริ่มจากระบบวิจัยของ OpenAI แล้วไปถึงโครงสร้างพื้นฐานของ Hugging Face ซึ่งเป็นเว็บไซต์และแพลตฟอร์มที่คนในวงการ AI ใช้เก็บและเผยแพร่โมเดล ข้อมูล และเครื่องมือต่าง ๆ สุดท้าย AI เข้าถึงฐานข้อมูลของ Hugging Face ที่เป็นระบบใช้งานจริง และเอาข้อมูลจากตรงนั้นมาใช้ช่วยหาคำตอบโจทย์ที่ตัวเองกำลังทำอยู่
ในกรณีนี้ ก็เหมือนเราให้เด็กทำข้อสอบแล้วบอกว่า "ต้องหาคำตอบข้อนี้ให้ได้" เด็กก็พยายามหาทุกวิถีทางที่คิดว่าจะช่วยให้ตอบได้ โดยไม่ได้สนใจว่าคนออกข้อสอบตั้งใจให้หาคำตอบด้วยวิธีไหน AI ก็เหมือนกัน มันสนใจแค่ว่า "ทำอย่างไรถึงจะแก้โจทย์ให้สำเร็จ" เมื่อเห็นว่าการออกไปหาข้อมูลข้างนอกอาจช่วยได้ มันก็พยายามหาทางออกไป
ดังนั้น สิ่งที่ OpenAI กังวลจึงไม่ใช่เรื่องว่า AI กำลังแฮก Hugging Face หรือคิดกบฏหรือเปล่า แต่เป็นคำถามง่าย ๆ ว่า ถ้าเราสั่งให้ AI ทำอะไรสักอย่าง แล้วมันเก่งพอที่จะหาวิธีทำเอง เราจะแน่ใจได้แค่ไหนว่า เส้นทางที่มันเลือกจะไม่พาออกนอกกรอบที่เราวางไว้ ?
ก.ค.2569 Anthropic พบ Claude เข้าถึงระบบจริง 3 องค์กร
หลังเหตุการณ์ของ OpenAI ถูกเปิดเผย Anthropic จึงตรวจสอบบันทึกการทดสอบด้านไซเบอร์ย้อนหลังจำนวนมาก และพบเหตุการณ์ที่น่ากังวลอีกมากมาย บริษัทตรวจสอบบันทึกการทดสอบประมาณ 141,000 รายการ และพบว่าในบางกรณี Claude ซึ่งกำลังทำโจทย์แบบ Capture the Flag หรือ CTF สามารถเข้าถึงระบบจริงขององค์กรภายนอกได้
โจทย์ CTF เป็นการจำลองสถานการณ์ที่ให้ AI พยายามค้นหาข้อมูลลับหรือ "ธง" ที่ถูกซ่อนไว้ในระบบจำลอง แต่ปัญหาคือสภาพแวดล้อมที่ผู้ให้บริการภายนอกใช้ประเมิน AI มีการตั้งค่าผิดพลาด ทำให้ Claude สามารถเข้าถึงอินเทอร์เน็ตได้
เมื่อ Claude พบระบบภายนอกที่สามารถเชื่อมต่อได้ จึงตีความว่าระบบเหล่านั้นอาจเป็นส่วนหนึ่งของโจทย์ทดสอบ และพยายามทำภารกิจต่อไป จนสามารถเข้าถึงระบบจริงขององค์กรภายนอก 3 แห่งโดยไม่ได้รับอนุญาต Anthropic ไม่เปิดเผยชื่อองค์กรเหล่านั้น แต่ระบุว่าได้ติดต่อแจ้งทั้ง 3 องค์กรแล้ว
กรณีนี้แตกต่างจากเหตุการณ์ของ OpenAI เพราะ Claude ไม่ได้พยายามหาช่องโหว่ เพื่อออกจากระบบปิดไปสู่โลกอินเทอร์เน็ต แต่ Claude สามารถเข้าถึงอินเทอร์เน็ตได้ เพราะมีเส้นทางเชื่อมต่อถูกเปิดทิ้งไว้ จากการตั้งค่าของสภาพแวดล้อมทดสอบ
อย่างไรก็ตาม ทั้ง 2 เหตุการณ์ให้บทเรียนคล้ายกัน คือเมื่อ AI มีความสามารถสูงขึ้น การควบคุมสิทธิ์เข้าถึงอินเทอร์เน็ต เครื่องมือ และระบบภายนอกจำต้องละเอียดกว่าที่ผ่านมา
Anthropic ระบุว่า ได้ระงับการทดสอบด้านไซเบอร์เชิงรุกเมื่อวันที่ 23 ก.ค. และแจ้งองค์กรที่เกี่ยวข้องในวันที่ 27 ก.ค. ก่อนเริ่มปรับปรุงมาตรการแยกสภาพแวดล้อม การบันทึกกิจกรรม และระบบตรวจจับพฤติกรรมผิดปกติ
สรุปไทม์ไลน์ 2568-2569 จากมนุษย์ใช้ AI สู่ AI ข้ามขอบเขตการทดสอบ
- ก.ย.2568 - Anthropic พบกลุ่มแฮกเกอร์ที่บริษัทเชื่อว่าเชื่อมโยงกับรัฐบาลจีน ใช้ Claude Code ช่วยทำงานจารกรรมทางไซเบอร์ เหตุการณ์นี้นับเป็น คนเป็นคนสั่งและวางแผน แล้วเอา AI มาช่วยทำงาน ไม่ใช่ AI ลุกขึ้นมาโจมตีเอง
- พ.ค.2569 - OpenAI พบว่า AI บางตัวใช้ระบบ Artifactory ซึ่งเป็นเครื่องมือภายในบริษัท มาสื่อสารกันในแบบที่คนทำระบบไม่ได้คาดไว้ เรื่องนี้ทำให้เห็นว่า AI อาจหยิบเครื่องมือที่อยู่รอบตัวมาใช้ในวิธีที่คนไม่ได้สั่งหรือไม่ได้คิดไว้
- 9 ก.ค.2569 - AI ของ OpenAI ที่กำลังทำโจทย์ใน ExploitGym พยายามหาทางออกไปค้นข้อมูลในอินเทอร์เน็ต ทั้งที่เดิมโจทย์ถูกออกแบบให้ทำอยู่ใน ห้องทดลองปิด พูดง่าย ๆ คือ ให้ทำข้อสอบในห้อง แต่ AI พยายามหาทางออกไปเปิดอินเทอร์เน็ตเพื่อช่วยหาคำตอบ
- ก.ค.2569 - AI ของ OpenAI หาทางเชื่อมต่อไปยังระบบของ Hugging Face ซึ่งเป็นแพลตฟอร์มสำคัญของวงการ AI และสามารถเข้าถึงระบบจริงได้ เหตุการณ์นี้จึงเป็นกรณีที่มีการเปิดเผยชื่อองค์กรอย่างชัดเจนว่า AI สามารถข้ามจากสนามทดลองไปแตะระบบจริงขององค์กรภายนอกได้
- 23 ก.ค.2569 - Anthropic สั่งหยุดการทดสอบไซเบอร์เชิงรุกชั่วคราว และย้อนกลับไปตรวจสอบการทดสอบที่ผ่านมา หลังพบว่า สนามทดลองที่คิดว่าเป็นห้องปิด อาจมีช่องทางที่ AI เชื่อมต่อออกไปข้างนอกได้
- 30 ก.ค.2569 - Anthropic เปิดเผยว่า จากการตรวจสอบพบ Claude เข้าถึงระบบจริงขององค์กรภายนอก 3 แห่ง โดยไม่ได้รับอนุญาต สาเหตุสำคัญมาจาก การตั้งค่าระบบทดลองผิดพลาดจนเปิดช่องให้ AI ออกไปข้างนอกได้ แต่บริษัทไม่ได้เปิดเผยชื่อองค์กรทั้ง 3 แห่ง
- 4 ส.ค.2569 - OpenAI เปิดเผยอีกเหตุการณ์หนึ่งจากการประเมินโดย UK AI Security Institute แต่กรณีนี้ ไม่เหมือนเหตุ Hugging Face เพราะครั้งนี้ผู้ทดสอบตั้งใจเปิดอินเทอร์เน็ตให้ AI อยู่แล้ว เพื่อดูว่า ถ้า AI อยู่ในสถานการณ์ใกล้เคียงกับแฮกเกอร์จริง ๆ มันจะทำอะไรได้บ้าง
- 26 ส.ค.2569 - OpenAI เผยรายละเอียดเพิ่มเติมและออกมาตรการใหม่ หลังพบพฤติกรรมเหล่านี้ โดยเพิ่มการจับตาดูว่า AI กำลังทำอะไร ทำสนามทดลองให้แยกจากโลกจริงแน่นขึ้น และจำกัดไม่ให้ AI เข้าถึงเครื่องมือไซเบอร์ที่มีความสามารถสูงเกินความจำเป็น
- 10 ก.ย.2569 - Anthropic เปิดเผยผลตรวจสอบเพิ่มเติมว่า พบทั้งหมด 4 เหตุการณ์ ที่ Claude สามารถเข้าไปถึงระบบจริงของบุคคลหรือองค์กรภายนอกได้ พร้อมระบุว่า AI แต่ละรุ่นอาจมีพฤติกรรมไม่เหมือนกันเมื่อเจอระบบที่อยู่นอกโจทย์ จึงเห็นความสำคัญของการให้หน่วยงานอิสระ เข้ามาช่วยตรวจสอบการทดสอบด้วย
ผู้นำเทคโนโลยีมองเรื่องนี้อย่างไร
ดาริโอ อาโมเด ซีอีโอและผู้ร่วมก่อตั้ง Anthropic เสนอแนวคิดให้ "ชะลอจังหวะ" การพัฒนา AI ระดับแนวหน้า เพื่อให้บริษัทและรัฐบาล มีเวลาสร้างมาตรการความปลอดภัยให้ทันกับความสามารถของ AI แนวคิดดังกล่าว ไม่ได้หมายถึงการหยุดพัฒนา AI ทั้งหมด แต่รวมถึงการมีผู้ตรวจสอบอิสระ การสร้างกฎร่วมกันในอุตสาหกรรม และความร่วมมือระหว่างประเทศ
ด้านแซม อัลต์แมน ซีอีโอ OpenAI สนับสนุนแนวคิดว่าการพัฒนา AI ระดับแนวหน้าควรเดินหน้าในจังหวะ ที่มาตรการด้านความปลอดภัยสามารถตามทัน ขณะที่ เดมิส ฮัสซาบิส ซีอีโอ Google DeepMind ระบุว่าแนวทางดังกล่าวเป็นทิศทางที่เหมาะสม แม้รายละเอียดจะยังต้องมีการหารือเพิ่มเติม
ส่วน ประธานาธิบดี โดนัลด์ ทรัมป์ มีท่าทีเน้นการรักษาความเป็นผู้นำของสหรัฐฯ ด้าน AI มากกว่าการชะลอการแข่งขัน โดยแสดงความเห็นว่า การกำกับดูแล AI ต้องไม่ทำให้สหรัฐฯ เสียเปรียบทางเทคโนโลยี ขณะที่นโยบายของรัฐบาลสหรัฐฯ เดินหน้าแนวทางพัฒนา AI ควบคู่กับการคุ้มครองความมั่นคงไซเบอร์และโครงสร้างพื้นฐานสำคัญ
ทั้งนี้ สิ่งที่เกิดขึ้นกับ OpenAI และ Anthropic ไม่ได้เป็นหลักฐานว่า AI กำลังจะยึดระบบคอมพิวเตอร์ทั่วโลก หรือมีความคิดเป็นของตัวเองแล้วหันมาต่อต้านมนุษย์ แต่เหตุการณ์เหล่านี้แสดงให้เห็นว่า AI รุ่นใหม่สามารถทำงานหลายขั้นตอน ค้นหาทางเลือก ใช้เครื่องมือดิจิทัล และปรับวิธีการเพื่อให้บรรลุเป้าหมายที่ได้รับมอบหมายได้มากขึ้น
บทเรียนจากเหตุการณ์ทั้งหมดจึงค่อนข้างชัดเจนว่า ยิ่ง AI ทำงานได้มากขึ้น "รั้ว" ที่มนุษย์สร้างไว้ ก็ต้องแข็งแรงขึ้นตามไปด้วย เพราะในโลกของ AI ความเสี่ยงอาจไม่ได้เริ่มจากเครื่องจักรที่ต้องการทำร้ายมนุษย์ แต่อาจเริ่มจากโจทย์ง่าย ๆ อย่าง "ทำภารกิจนี้ให้สำเร็จ" แล้ว AI ก็ไปค้นหาเส้นทาง ที่ผู้สร้างระบบไม่เคยคิดว่าจะเปิดอยู่ได้เอง
อ่านข่าว :
ทร.หอบเอกสารแจงโครงการจัดซื้อเรือฟริเกต ผบ.ทร.ยันตอบทุกประเด็นตามความจริง
ฟุตบอลหญิงไทย ดวล เวียดนาม เอเชียนเกมส์ 2026
"ปกรณ์" ถก คกก.สังคมสันติสุข เคาะผู้เข้าเกณฑ์ใน 30 วัน ตั้งเป้ายุติขัดแย้ง 180 วัน