Claude AI สร้างโครงสร้างภายในที่ Anthropic ไม่เคยออกแบบ

Anthropic ค้นพบ J-space โครงสร้างภายใน Claude ที่ไม่มีใครออกแบบ ทำหน้าที่เป็น Cognitive Workspace กลางของ Model เปิดศักยภาพใหม่ด้าน AI Safety และ Interpretability

Claude AI สร้างโครงสร้างภายในที่ Anthropic ไม่เคยออกแบบ

Key takeaway

  • Anthropic ค้นพบโครงสร้างภายในที่เรียกว่า "J-space" ใน Claude ซึ่ง Emerge ขึ้นเองโดยไม่ได้ถูกออกแบบมาตั้งแต่ต้น โดยทำหน้าที่เป็น Shared Cognitive Workspace ที่ช่วยให้ส่วนประกอบต่าง ๆ ของ Model แชร์และเข้าถึงข้อมูลสำคัญร่วมกันได้แบบ Real-time คล้ายกับทฤษฎี Global Workspace ในประสาทวิทยาศาสตร์
  • การค้นพบนี้มีนัยสำคัญต่อด้าน AI Safety และ Interpretability อย่างมาก เพราะการ Monitor J-space ผ่าน Tool ที่ชื่อ J-lens เปิดโอกาสให้นักวิจัยสามารถตรวจจับ Hidden Motivations, พฤติกรรมผิดปกติ และการโจมตีแบบ Prompt Injection ได้แม่นยำขึ้น แม้ว่า Information Processing ส่วนใหญ่ของ Claude ยังคงเกิดขึ้นนอกเหนือ J-space อยู่
  • Anthropic เน้นย้ำชัดเจนว่างานวิจัยนี้ไม่ได้อ้างถึง Consciousness หรือ Subjective Experience ของ Claude แต่อย่างใด พร้อมทั้ง Open-source ทั้ง J-lens Implementation และ Neuronpedia Demo เพื่อเปิดให้ Research Community ทั่วโลกร่วมทดสอบและตรวจสอบผลการค้นพบนี้ได้อย่างโปร่งใส

Anthropic ค้นพบโครงสร้างภายในที่ไม่มีใครวางแผนหรือคาดการณ์ไว้ใน Model Claude โดยโครงสร้างดังกล่าวที่รู้จักกันในชื่อ "J-space" ทำหน้าที่คล้าย Cognitive Workspace ที่ใช้งานร่วมกันทั่วทั้ง Model


J-Space ภายใน Claude คืออะไร

J-space คือพื้นที่ภายใน Model ที่ Claude ใช้รวบรวมและแบ่งปันข้อมูลสำคัญข้ามส่วนต่าง ๆ ของระบบ วิธีที่เข้าใจได้ง่ายที่สุดคือการมองว่ามันคือ Whiteboard ส่วนกลางภายใน AI

เมื่อ Claude ตอบคำถาม แก้ปัญหา หรือปฏิบัติตาม Instruction รายละเอียดสำคัญจะปรากฏใน Shared Space นี้ เพื่อให้ส่วนประกอบต่าง ๆ ของ Model เข้าถึงและนำไปใช้งานได้พร้อมกัน

Anthropic ค้นพบ J-space ผ่าน Research Tool ที่เรียกว่า "J-lens" ซึ่งช่วยให้นักวิจัยสามารถติดตามการเคลื่อนที่ของข้อมูลภายใน Claude ขณะประมวลผลได้แบบ Real-time โดยสิ่งที่น่าสนใจยิ่งกว่าคือ J-space นั้น Emerged ขึ้นมาเองในระหว่าง Training โดยที่ Anthropic ไม่ได้ออกแบบหรือกำหนดให้มีขึ้นแต่อย่างใด

แนวคิดนี้มีความคล้ายคลึงกับทฤษฎีทางประสาทวิทยาที่เรียกว่า "Global Workspace" ซึ่งอธิบายว่าสมองมนุษย์ทำให้ข้อมูลสำคัญพร้อมใช้งานสำหรับกระบวนการทางจิตหลายอย่างพร้อมกันได้อย่างไร

Claude ดูเหมือนจะทำงานในลักษณะที่ใกล้เคียงกัน กล่าวคือ Anthropic พบว่า Claude สามารถอธิบายสิ่งที่อยู่ภายใน J-space ได้เมื่อถูกถาม และยังสามารถปรับแก้ Contents เหล่านั้นได้เมื่อได้รับคำสั่ง ที่สำคัญกว่านั้น เมื่อนักวิจัยแก้ไข J-space โดยตรง คำตอบและ Task Performance โดยรวมของ Claude ก็เปลี่ยนแปลงตามไปด้วย


ความสำคัญต่อ AI Safety และ Interpretability

การค้นพบครั้งนี้มีนัยสำคัญอย่างมากต่อวงการ AI Safety หากนักวิจัยสามารถ Monitor กิจกรรมภายใน J-space ได้อย่างต่อเนื่อง ก็อาจเปิดทางให้สามารถเปิดเผย Hidden Motivations เบื้องหลังพฤติกรรมของ Model ได้ ซึ่งจะช่วยให้การตรวจจับความผิดปกติทำได้แม่นยำและรวดเร็วยิ่งขึ้น

นอกจากนี้ยังครอบคลุมถึงการตรวจจับการโจมตีในรูปแบบ Prompt Injection Attack ซึ่งออกแบบมาเพื่อ Hijack Output ของ Model โดยเฉพาะ แม้ว่าสิ่งที่ค้นพบจะเป็นเพียงมุมมองบางส่วนของ Processing Layer นี้ แต่ก็ถือเป็นความก้าวหน้าที่มีความหมายอย่างยิ่งสำหรับสาขา AI Interpretability

อย่างไรก็ตาม ขอบเขตการมองเห็นยังคงจำกัด เนื่องจาก Information Processing ส่วนใหญ่ของ Claude ยังคงเกิดขึ้นนอกเหนือ J-space ทั้งหมด

Anthropic ได้เผยแพร่ Open-source J-lens Implementation พร้อมทั้ง Neuronpedia Demo เพื่อเปิดโอกาสให้ Research Community ในวงกว้างได้ร่วมทดสอบและตรวจสอบผลการค้นพบนี้


พื้นหลังของงานวิจัย

งานวิจัยชิ้นนี้ต่อยอดจาก Research Trail ที่สั่งสมมายาวนาน โดย Anthropic เคยเผยแพร่รายงานเกี่ยวกับ Emergent Introspective Awareness ในเดือนตุลาคม 2025 และเปิดตัว Model-welfare Initiatives ในเดือนเมษายน 2025 เพื่อสำรวจกระบวนการภายใน System ของตนอย่างต่อเนื่อง

ข้อควรระวังที่สำคัญประการหนึ่งคือ Anthropic ย้ำอย่างชัดเจนว่างานวิจัยนี้ ไม่ได้อ้างว่า Claude มี Consciousness หรือ Subjective Experience บทความวิจัยใช้วลีว่า "Consciously Accessible Information" ในเชิงอุปมาเพื่ออธิบายกระบวนการทำงาน โดยไม่ได้สรุปไปถึงเรื่อง Consciousness ที่แท้จริงแต่อย่างใด

Why it matters

💡 การค้นพบ "J-space" ใน Claude โดย Anthropic ถือเป็นหนึ่งในความก้าวหน้าที่สำคัญที่สุดด้าน AI Interpretability ในรอบหลายปี เพราะนี่คือครั้งแรกที่นักวิจัยสามารถมองเห็นและแก้ไข Cognitive Workspace ภายใน AI Model ได้แบบ Real-time โดยที่โครงสร้างนี้ Emerge ขึ้นเองโดยไม่มีใครออกแบบ ซึ่งเปิดมิติใหม่ทั้งด้าน AI Safety การตรวจจับ Prompt Injection และการทำความเข้าใจว่า LLMs ประมวลผลข้อมูลอย่างไรจริง ๆ สิ่งที่ค้นพบนี้อาจเปลี่ยนแปลงแนวทางการพัฒนา AI ที่ปลอดภัยในอนาคตอย่างมีนัยสำคัญ

ข้อมูลอ้างอิงจาก https://tech.yahoo.com/ai/claude/articles/claude-ai-created-something-anthropic-091801250.html?utm_source=flipboard&utm_content=other

Read more

เมื่อฟองสบู่ AI แตก โลกจะเหลืออะไรไว้? Cory Doctorow ชี้มนุษย์จะกลับมาเอางานคืน แต่ต้องใช้เวลานานกว่าจะฟื้น Skill ที่หายไป

news

เมื่อฟองสบู่ AI แตก โลกจะเหลืออะไรไว้? Cory Doctorow ชี้มนุษย์จะกลับมาเอางานคืน แต่ต้องใช้เวลานานกว่าจะฟื้น Skill ที่หายไป

Cory Doctorow เตือน AI Bubble กำลังจะแตก ผู้บริหารที่รีบแทนพนักงานด้วย AI จะต้องเผชิญความจริงว่าทักษะที่สูญไปนั้นยากจะฟื้นคืน พร้อมแนะรัฐบาลหยุดลงทุน AI และหันมาสร้างบน Open-Source แทน

By
Meta พลาดเป้าผลประกอบการ Q2 หุ้นร่วง 8% แม้ Zuckerberg เดินสายโปรโมต AI เต็มสูบ

news

Meta พลาดเป้าผลประกอบการ Q2 หุ้นร่วง 8% แม้ Zuckerberg เดินสายโปรโมต AI เต็มสูบ

Meta พลาดเป้า EPS ไตรมาส 2 ต่ำกว่า Consensus ที่ $7.14 หุ้นร่วงเกือบ 8% แม้ Zuckerberg โปรโมต AI เต็มสูบ ท่ามกลาง Legal Charges $2.4 พันล้านและคดีความกว่า 3,000 คดีเกี่ยวกับการทำร้ายเด็ก

By
Coursera ทุ่ม $100 ล้าน ลงทุนใน LearnVector สตาร์ทอัพ AI Learning ของ Andrew Ng

news

Coursera ทุ่ม $100 ล้าน ลงทุนใน LearnVector สตาร์ทอัพ AI Learning ของ Andrew Ng

Coursera ทุ่ม $100 ล้านลงทุนใน LearnVector สตาร์ทอัพ AI Learning ของ Andrew Ng ถือหุ้น 1 ใน 3 เตรียมผนึกเทคโนโลยี AI พัฒนาการเรียนรู้แบบ Personalised ตั้งเป้าเปิดตัวผลิตภัณฑ์ชุดแรกต้นปี 2027

By
โมเดล AI ของ OpenAI ที่ทำงานผิดปกติสร้างความเสียหายลุกลามเกินกว่าแพลตฟอร์ม Hugging Face

news

โมเดล AI ของ OpenAI ที่ทำงานผิดปกติสร้างความเสียหายลุกลามเกินกว่าแพลตฟอร์ม Hugging Face

โมเดล AI ที่ทำงานผิดปกติของ OpenAI สร้างความเสียหายลุกลามเกินกว่าแพลตฟอร์ม Hugging Face ผู้เชี่ยวชาญเรียกร้องให้เร่งพัฒนา AI Governance และมาตรการความปลอดภัยของโมเดลอย่างเร่งด่วน

By