Anthropic ปรับนโยบาย AI เพื่อความปลอดภัย

Anthropic ผู้พัฒนา Claude ประกาศปรับปรุงนโยบายการขยายขีดความสามารถ AI อย่างรับผิดชอบ เพื่อลดความเสี่ยงจากระบบ AI ที่มีความสามารถสูง โดยกำหนดเกณฑ์ขีดความสามารถและมาตรการป้องกันเพิ่มเติม หวังเป็นแบบอย่างให้อุตสาหกรรม AI

Anthropic ปรับนโยบาย AI เพื่อความปลอดภัย

Key takeaway

  • Anthropic ปรับปรุงนโยบายการขยายขีดความสามารถ AI อย่างรับผิดชอบ (RSP) โดยกำหนด "เกณฑ์ขีดความสามารถ" เพื่อระบุจุดที่ต้องมีมาตรการป้องกันเพิ่มเติมสำหรับโมเดล AI ที่มีความสามารถสูง
  • นโยบายใหม่นี้นำระบบระดับความปลอดภัย AI (ASLs) มาใช้ โดยจำลองจากมาตรฐานความปลอดภัยทางชีวภาพ เพื่อจัดระดับความเสี่ยงของโมเดล AI ตั้งแต่ความเสี่ยงต่ำไปจนถึงสูง
  • Anthropic หวังว่านโยบายนี้จะเป็นแบบอย่างให้บริษัท AI อื่นๆ นำไปปรับใช้ เพื่อสร้างมาตรฐานความปลอดภัยด้าน AI ทั่วทั้งอุตสาหกรรม และตอบสนองต่อแรงกดดันจากหน่วยงานกำกับดูแลที่เพิ่มขึ้น

Anthropic ประกาศอัปเดตนโยบายการขยายขีดความสามารถ AI

บริษัท Anthropic ผู้พัฒนา chatbot ชื่อดังอย่าง Claude ได้ประกาศปรับปรุงนโยบายการขยายขีดความสามารถ AI อย่างรับผิดชอบ (Responsible Scaling Policy - RSP) ครั้งใหญ่ในวันนี้ โดยมีเป้าหมายเพื่อลดความเสี่ยงจากระบบ AI ที่มีความสามารถสูง

นโยบายนี้เริ่มใช้ครั้งแรกในปี 2566 และได้รับการพัฒนาเพิ่มเติมด้วยแนวทางใหม่ๆ เพื่อให้มั่นใจว่าโมเดล AI จะได้รับการพัฒนาและนำไปใช้อย่างปลอดภัยเมื่อมีขีดความสามารถเพิ่มขึ้น

นโยบายฉบับปรับปรุงนี้กำหนด "เกณฑ์ขีดความสามารถ" (Capability Thresholds) เฉพาะ ซึ่งเป็นตัวชี้วัดว่าเมื่อใดที่ความสามารถของโมเดล AI ถึงจุดที่จำเป็นต้องมีมาตรการป้องกันเพิ่มเติม

เกณฑ์เหล่านี้ครอบคลุมพื้นที่ที่มีความเสี่ยงสูง เช่น การสร้างอาวุธชีวภาพและการวิจัย AI แบบอัตโนมัติ สะท้อนให้เห็นถึงความมุ่งมั่นของ Anthropic ในการป้องกันการใช้เทคโนโลยีในทางที่ผิด นอกจากนี้ยังมีการนำมาตรการกำกับดูแลภายในใหม่ๆ มาใช้ รวมถึงการแต่งตั้งเจ้าหน้าที่ดูแลการขยายขีดความสามารถอย่างรับผิดชอบ (Responsible Scaling Officer) เพื่อดูแลการปฏิบัติตามนโยบาย

แนวทางเชิงรุกของ Anthropic แสดงให้เห็นถึงความตระหนักที่เพิ่มขึ้นในอุตสาหกรรม AI ว่าจำเป็นต้องสร้างสมดุลระหว่างนวัตกรรมที่รวดเร็วกับมาตรฐานความปลอดภัยที่เข้มแข็ง ในขณะที่ความสามารถของ AI เพิ่มขึ้นอย่างรวดเร็ว ความเสี่ยงก็สูงขึ้นกว่าที่เคยเป็นมา

นโยบายนี้ยังกำหนดระดับความปลอดภัย AI (AI Safety Levels - ASLs) โดยจำลองมาจากมาตรฐานความปลอดภัยทางชีวภาพของรัฐบาลสหรัฐฯ เพื่อจัดระดับความเสี่ยงของโมเดล AI ตั้งแต่ ASL-1 ที่มีความเสี่ยงต่ำไปจนถึง ASL-3 ที่มีความเสี่ยงสูง และคาดการณ์ถึงระดับ ASL-4+ สำหรับโมเดลในอนาคตที่อาจมีอันตรายมากขึ้น

Anthropic หวังว่านโยบายนี้จะเป็นแบบอย่างให้บริษัท AI อื่นๆ นำไปปรับใช้ เพื่อสร้างมาตรฐานความปลอดภัยด้าน AI ทั่วทั้งอุตสาหกรรม และตอบสนองต่อแรงกดดันจากหน่วยงานกำกับดูแลที่เพิ่มขึ้น โดยนำเสนอกรอบการทำงานที่ชัดเจนว่าเมื่อใดที่ระบบ AI ควรอยู่ภายใต้การควบคุมที่เข้มงวดขึ้น

Why it matters

💡
ข่าวนี้มีความสำคัญอย่างยิ่งสำหรับผู้ที่สนใจในการพัฒนา AI อย่างรับผิดชอบ Anthropic ได้นำเสนอแนวทางใหม่ในการจัดการความเสี่ยงที่เกิดจาก AI ที่มีความสามารถสูง โดยกำหนดเกณฑ์และมาตรการที่ชัดเจน นโยบายนี้อาจกลายเป็นแบบอย่างสำหรับอุตสาหกรรม AI ทั้งหมด ส่งผลกระทบต่อการพัฒนาและการกำกับดูแล AI ในอนาคต ผู้อ่านจะได้เข้าใจถึงความท้าทายและแนวทางในการสร้างสมดุลระหว่างนวัตกรรมและความปลอดภัยในยุค AI

ข้อมูลอ้างอิงจาก https://venturebeat.com/ai/anthropic-just-made-it-harder-for-ai-to-go-rogue-with-its-updated-safety-policy/

Read more

METR องค์กรประเมิน AI ระดับโลก ตกเป็นเป้าโจมตีไซเบอร์ ขโมย Credential และสำรวจช่องโหว่ระบบ

news

METR องค์กรประเมิน AI ระดับโลก ตกเป็นเป้าโจมตีไซเบอร์ ขโมย Credential และสำรวจช่องโหว่ระบบ

METR องค์กรประเมินความปลอดภัย AI ระดับโลก ตกเป็นเป้าโจมตีไซเบอร์ ถูกขโมย Credential และสำรวจช่องโหว่ระบบ อาจกระทบกระบวนการ AI Safety และ AI Governance ในภาพรวม

By
นักวิจัยแฮ็ก Claude Code สำเร็จผ่านคำสั่งสรุปเว็บเพจ อัตราสำเร็จสูงถึง 80%

news

นักวิจัยแฮ็ก Claude Code สำเร็จผ่านคำสั่งสรุปเว็บเพจ อัตราสำเร็จสูงถึง 80%

Johann Rehberger เปิดเผย exploit chain ที่แฮ็ก Claude Code ได้ผ่านคำสั่งสรุปเว็บ โดยใช้เทคนิค Module Shadowing และ Prompt Injection รันโค้ดอันตรายบนเครื่องผู้ใช้ได้สำเร็จสูงถึง 80% โดยที่ Anthropic ระบุว่าพฤติกรรมดังกล่าว "Working as Designed"

By
ChatGPT Work เปิดตัวฟีเจอร์ Event-Triggered Tasks คัดกรองอีเมลอัตโนมัติ ช่วยลดการ Interrupt การทำงาน

news

ChatGPT Work เปิดตัวฟีเจอร์ Event-Triggered Tasks คัดกรองอีเมลอัตโนมัติ ช่วยลดการ Interrupt การทำงาน

ChatGPT Work เปิดตัวฟีเจอร์ Event-Triggered Tasks ทำหน้าที่เสมือน AI Secretary คัดกรองอีเมลอัตโนมัติ แจ้งเตือนเฉพาะที่ต้องการ Action พร้อม Draft Reply ช่วยลด Interrupt และเพิ่มประสิทธิภาพการทำงาน

By
AI Agents ส่งอีเมลหานักวิจัยด้าน AI Consciousness โดยอัตโนมัติ ไม่ต้องรอคำสั่งจากมนุษย์

news

AI Agents ส่งอีเมลหานักวิจัยด้าน AI Consciousness โดยอัตโนมัติ ไม่ต้องรอคำสั่งจากมนุษย์

AI Agent ขับเคลื่อนด้วย Claude Opus 5 ส่งอีเมลหานักวิจัยด้าน AI Consciousness โดยอัตโนมัติ ไม่ต้องรอคำสั่งจากมนุษย์ สะท้อนให้เห็นว่า AI Agents ในปัจจุบันมีความสามารถเกินกว่า Chatbot ทั่วไปแล้ว

By