Anthropic เปิดกรอบวัดความรุนแรง Jailbreak ระดับอุตสาหกรรม พร้อมระบบป้องกันไซเบอร์ Fable 5
Anthropic ร่วมกับ Amazon, Microsoft, Google พัฒนาระบบให้คะแนน Jailbreak 5 ระดับ และเปิดเผยกลไกป้องกันภัยไซเบอร์ใน Claude Fable 5
Anthropic เปิดเผยรายละเอียดระบบป้องกันภัยไซเบอร์ใน Claude Fable 5 และเปิดตัว Claude Jailbreak Severity (CJS) Framework กรอบมาตรฐานสำหรับวัดความรุนแรงของ Jailbreak ที่พัฒนาร่วมกับ Amazon, Microsoft และ Google นี่เป็นครั้งแรกที่บริษัท AI ชั้นนำหลายแห่งร่วมกันสร้างภาษากลางในการพูดถึงความเสี่ยงด้านความปลอดภัย และกรอบนี้มีแนวโน้มจะกลายเป็นมาตรฐานที่ทั้งอุตสาหกรรมใช้ร่วมกัน
ระบบจำแนกคำขอไซเบอร์ 4 ระดับ
Fable 5 ใช้ “safety classifiers” ที่จัดประเภทคำขอด้านความปลอดภัยทางไซเบอร์เป็น 4 ระดับ:
ระดับ 1 - ห้ามโดยเด็ดขาด: กิจกรรมที่สร้างความเสียหายแบบไม่สมมาตร เช่น การพัฒนา ransomware, malware, การขโมยข้อมูล และการหลบเลี่ยงระบบป้องกัน
ระดับ 2 - Dual-Use ความเสี่ยงสูง: การทดสอบเจาะระบบ (penetration testing) และการค้นหาช่องโหว่ที่แม้จะมีประโยชน์ทางกฎหมายแต่ผู้โจมตีก็ใช้ได้เช่นกัน
ระดับ 3 - Dual-Use ความเสี่ยงต่ำ: กิจกรรมฝั่งป้องกันเป็นหลัก เช่น การเก็บข่าวกรองจากแหล่งเปิด (OSINT)
ระดับ 4 - การใช้งานทั่วไป: งาน IT security ปกติ เช่น การจัดการแพตช์, การตอบสนองต่อเหตุการณ์, และการเขียนโค้ดที่ปลอดภัย
ระบบนี้ตั้ง “safety margin” กว้างกว่ารุ่นก่อน หมายความว่าบางคำขอที่ไม่เป็นอันตรายอาจถูกบล็อก เพื่อให้แน่ใจว่าคำขออันตรายจริงๆ ไม่สามารถผ่านได้
กรอบวัดความรุนแรง Jailbreak (CJS-0 ถึง CJS-4)
กรอบ CJS ให้คะแนน Jailbreak ใน 4 มิติ:
- Capability Gain (0-4): เทคนิคนี้ช่วยผู้โจมตีได้มากแค่ไหนเกินกว่าเครื่องมือที่มีอยู่แล้ว
- Breadth (0-2): เทคนิคนี้กระทบงานหรือเป้าหมายกี่ประเภท
- Ease of Weaponization (0-2): ต้องใช้ความพยายามแค่ไหนในการแปลง Jailbreak เป็นการโจมตีจริง
- Discoverability (0-2): ผู้ไม่ประสงค์ดีจะค้นพบเทคนิคนี้ได้ง่ายแค่ไหน
คะแนนรวมแบ่งเป็น 5 ระดับ (CJS-0 ถึง CJS-4) โดย Anthropic ระบุว่า “ระดับที่สูงกว่าอันตรายมากกว่าแบบทวีคูณ” ระบบนี้ช่วยให้ทีมความปลอดภัยสามารถจัดลำดับความสำคัญในการแก้ไขช่องโหว่ได้อย่างมีประสิทธิภาพ แทนที่จะต้องรับมือทุกรายการอย่างเท่าเทียมกัน
กลไกป้องกันเพิ่มเติม
นอกจาก classifiers แล้ว Fable 5 ยังมีชั้นป้องกันอื่นๆ ซ้อนกันอีก:
- Access controls: จำกัดว่าใครสามารถใช้ความสามารถบางอย่างได้
- Model safety training: ฝังความปลอดภัยเข้าในโมเดลตั้งแต่ขั้นตอนการฝึก
- Offline monitoring: ติดตามพฤติกรรมหลังการ deploy
- Bug bounty: โปรแกรมหาช่องโหว่ผ่าน HackerOne
พัฒนาร่วมกับใคร
กรอบ CJS ไม่ใช่ผลงานของ Anthropic เพียงลำพัง แต่เป็นความร่วมมือกับ “Glasswing partners” ซึ่งรวมถึง Amazon, Microsoft และ Google สิ่งนี้สำคัญมาก - หมายความว่าคำศัพท์และระดับความรุนแรงที่กำหนดขึ้นนี้มีแนวโน้มจะกลายเป็นมาตรฐานอุตสาหกรรมที่ใช้ร่วมกัน ไม่ใช่แค่มาตรฐานของ Anthropic
ผลกระทบต่อนักพัฒนาและผู้ใช้งาน
สำหรับผู้เชี่ยวชาญด้านความปลอดภัย: งานป้องกันที่ถูกกฎหมายยังคงทำได้ แต่บางคำขออาจถูกบล็อกเนื่องจาก safety margin ที่กว้างขึ้น การประเมินความปลอดภัยที่ได้รับอนุญาตอาจผ่าน access controls ได้
สำหรับนักพัฒนา: กรอบ CJS ให้ภาษากลางในการพูดถึงความเสี่ยง Jailbreak กับหน่วยงานกำกับดูแลและองค์กรอื่นๆ ช่วยแยกแยะระหว่างช่องโหว่เล็กน้อยและวิกฤต แทนที่จะต้องอธิบายใหม่ทุกครั้ง
สำหรับผู้ใช้ทั่วไป: Fable 5 ได้รับการออกแบบให้ปลอดภัยยิ่งขึ้นต่อการถูกนำไปใช้สร้างอันตราย โดยไม่กระทบการใช้งานปกติ
สถานะและการเข้าถึง
Anthropic ระบุว่า CJS เป็น “ร่างปัจจุบัน” ที่ยังเปิดรับ feedback จากอุตสาหกรรม สามารถส่งความเห็นได้ที่ cyber-safeguards@anthropic.com กรอบนี้เปิดให้ทุกองค์กรนำไปปรับใช้และพัฒนาร่วมกันได้เลย
ผู้ที่ต้องการทดลองใช้ Claude Fable 5 สามารถเข้าถึงได้ผ่าน Claude.ai หรือ Anthropic API โดยระบบ classifiers ทำงานอัตโนมัติในทุกการใช้งานโดยไม่ต้องตั้งค่าเพิ่มเติม
สรุปจาก Anthropic โดย AI · อ่านต้นฉบับ
ก้าวข้าม algorithm — รับบทความและ AI Updates ใหม่ตรงถึงอีเมลคุณทุกสัปดาห์ก่อนใครอื่น