News

Anthropic เปิดกรอบวัดความรุนแรง Jailbreak ระดับอุตสาหกรรม พร้อมระบบป้องกันไซเบอร์ Fable 5

2 กรกฎาคม 2026 อ่าน 4 นาที ⟳ Source-tracked

Anthropic ร่วมกับ Amazon, Microsoft, Google พัฒนาระบบให้คะแนน Jailbreak 5 ระดับ และเปิดเผยกลไกป้องกันภัยไซเบอร์ใน Claude Fable 5

สรุปบทความนี้ด้วย AI

Anthropic เปิดเผยรายละเอียดระบบป้องกันภัยไซเบอร์ใน Claude Fable 5 และเปิดตัว Claude Jailbreak Severity (CJS) Framework กรอบมาตรฐานสำหรับวัดความรุนแรงของ Jailbreak ที่พัฒนาร่วมกับ Amazon, Microsoft และ Google นี่เป็นครั้งแรกที่บริษัท AI ชั้นนำหลายแห่งร่วมกันสร้างภาษากลางในการพูดถึงความเสี่ยงด้านความปลอดภัย และกรอบนี้มีแนวโน้มจะกลายเป็นมาตรฐานที่ทั้งอุตสาหกรรมใช้ร่วมกัน

ระบบจำแนกคำขอไซเบอร์ 4 ระดับ

Fable 5 ใช้ “safety classifiers” ที่จัดประเภทคำขอด้านความปลอดภัยทางไซเบอร์เป็น 4 ระดับ:

ระดับ 1 - ห้ามโดยเด็ดขาด: กิจกรรมที่สร้างความเสียหายแบบไม่สมมาตร เช่น การพัฒนา ransomware, malware, การขโมยข้อมูล และการหลบเลี่ยงระบบป้องกัน

ระดับ 2 - Dual-Use ความเสี่ยงสูง: การทดสอบเจาะระบบ (penetration testing) และการค้นหาช่องโหว่ที่แม้จะมีประโยชน์ทางกฎหมายแต่ผู้โจมตีก็ใช้ได้เช่นกัน

ระดับ 3 - Dual-Use ความเสี่ยงต่ำ: กิจกรรมฝั่งป้องกันเป็นหลัก เช่น การเก็บข่าวกรองจากแหล่งเปิด (OSINT)

ระดับ 4 - การใช้งานทั่วไป: งาน IT security ปกติ เช่น การจัดการแพตช์, การตอบสนองต่อเหตุการณ์, และการเขียนโค้ดที่ปลอดภัย

ระบบนี้ตั้ง “safety margin” กว้างกว่ารุ่นก่อน หมายความว่าบางคำขอที่ไม่เป็นอันตรายอาจถูกบล็อก เพื่อให้แน่ใจว่าคำขออันตรายจริงๆ ไม่สามารถผ่านได้

กรอบวัดความรุนแรง Jailbreak (CJS-0 ถึง CJS-4)

กรอบ CJS ให้คะแนน Jailbreak ใน 4 มิติ:

  • Capability Gain (0-4): เทคนิคนี้ช่วยผู้โจมตีได้มากแค่ไหนเกินกว่าเครื่องมือที่มีอยู่แล้ว
  • Breadth (0-2): เทคนิคนี้กระทบงานหรือเป้าหมายกี่ประเภท
  • Ease of Weaponization (0-2): ต้องใช้ความพยายามแค่ไหนในการแปลง Jailbreak เป็นการโจมตีจริง
  • Discoverability (0-2): ผู้ไม่ประสงค์ดีจะค้นพบเทคนิคนี้ได้ง่ายแค่ไหน

คะแนนรวมแบ่งเป็น 5 ระดับ (CJS-0 ถึง CJS-4) โดย Anthropic ระบุว่า “ระดับที่สูงกว่าอันตรายมากกว่าแบบทวีคูณ” ระบบนี้ช่วยให้ทีมความปลอดภัยสามารถจัดลำดับความสำคัญในการแก้ไขช่องโหว่ได้อย่างมีประสิทธิภาพ แทนที่จะต้องรับมือทุกรายการอย่างเท่าเทียมกัน

กลไกป้องกันเพิ่มเติม

นอกจาก classifiers แล้ว Fable 5 ยังมีชั้นป้องกันอื่นๆ ซ้อนกันอีก:

  • Access controls: จำกัดว่าใครสามารถใช้ความสามารถบางอย่างได้
  • Model safety training: ฝังความปลอดภัยเข้าในโมเดลตั้งแต่ขั้นตอนการฝึก
  • Offline monitoring: ติดตามพฤติกรรมหลังการ deploy
  • Bug bounty: โปรแกรมหาช่องโหว่ผ่าน HackerOne

พัฒนาร่วมกับใคร

กรอบ CJS ไม่ใช่ผลงานของ Anthropic เพียงลำพัง แต่เป็นความร่วมมือกับ “Glasswing partners” ซึ่งรวมถึง Amazon, Microsoft และ Google สิ่งนี้สำคัญมาก - หมายความว่าคำศัพท์และระดับความรุนแรงที่กำหนดขึ้นนี้มีแนวโน้มจะกลายเป็นมาตรฐานอุตสาหกรรมที่ใช้ร่วมกัน ไม่ใช่แค่มาตรฐานของ Anthropic

ผลกระทบต่อนักพัฒนาและผู้ใช้งาน

สำหรับผู้เชี่ยวชาญด้านความปลอดภัย: งานป้องกันที่ถูกกฎหมายยังคงทำได้ แต่บางคำขออาจถูกบล็อกเนื่องจาก safety margin ที่กว้างขึ้น การประเมินความปลอดภัยที่ได้รับอนุญาตอาจผ่าน access controls ได้

สำหรับนักพัฒนา: กรอบ CJS ให้ภาษากลางในการพูดถึงความเสี่ยง Jailbreak กับหน่วยงานกำกับดูแลและองค์กรอื่นๆ ช่วยแยกแยะระหว่างช่องโหว่เล็กน้อยและวิกฤต แทนที่จะต้องอธิบายใหม่ทุกครั้ง

สำหรับผู้ใช้ทั่วไป: Fable 5 ได้รับการออกแบบให้ปลอดภัยยิ่งขึ้นต่อการถูกนำไปใช้สร้างอันตราย โดยไม่กระทบการใช้งานปกติ

สถานะและการเข้าถึง

Anthropic ระบุว่า CJS เป็น “ร่างปัจจุบัน” ที่ยังเปิดรับ feedback จากอุตสาหกรรม สามารถส่งความเห็นได้ที่ cyber-safeguards@anthropic.com กรอบนี้เปิดให้ทุกองค์กรนำไปปรับใช้และพัฒนาร่วมกันได้เลย

ผู้ที่ต้องการทดลองใช้ Claude Fable 5 สามารถเข้าถึงได้ผ่าน Claude.ai หรือ Anthropic API โดยระบบ classifiers ทำงานอัตโนมัติในทุกการใช้งานโดยไม่ต้องตั้งค่าเพิ่มเติม


สรุปจาก Anthropic โดย AI · อ่านต้นฉบับ

รับจดหมายข่าวStay human. Stay in the loop.

ก้าวข้าม algorithm — รับบทความและ AI Updates ใหม่ตรงถึงอีเมลคุณทุกสัปดาห์ก่อนใครอื่น