Claude AI สร้างโครงสร้างภายในที่ Anthropic ไม่เคยออกแบบ

Anthropic ค้นพบ J-space โครงสร้างภายใน Claude ที่ไม่มีใครออกแบบ ทำหน้าที่เป็น Cognitive Workspace กลางของ Model เปิดศักยภาพใหม่ด้าน AI Safety และ Interpretability

Claude AI สร้างโครงสร้างภายในที่ Anthropic ไม่เคยออกแบบ

Key takeaway

  • Anthropic ค้นพบโครงสร้างภายในที่เรียกว่า "J-space" ใน Claude ซึ่ง Emerge ขึ้นเองโดยไม่ได้ถูกออกแบบมาตั้งแต่ต้น โดยทำหน้าที่เป็น Shared Cognitive Workspace ที่ช่วยให้ส่วนประกอบต่าง ๆ ของ Model แชร์และเข้าถึงข้อมูลสำคัญร่วมกันได้แบบ Real-time คล้ายกับทฤษฎี Global Workspace ในประสาทวิทยาศาสตร์
  • การค้นพบนี้มีนัยสำคัญต่อด้าน AI Safety และ Interpretability อย่างมาก เพราะการ Monitor J-space ผ่าน Tool ที่ชื่อ J-lens เปิดโอกาสให้นักวิจัยสามารถตรวจจับ Hidden Motivations, พฤติกรรมผิดปกติ และการโจมตีแบบ Prompt Injection ได้แม่นยำขึ้น แม้ว่า Information Processing ส่วนใหญ่ของ Claude ยังคงเกิดขึ้นนอกเหนือ J-space อยู่
  • Anthropic เน้นย้ำชัดเจนว่างานวิจัยนี้ไม่ได้อ้างถึง Consciousness หรือ Subjective Experience ของ Claude แต่อย่างใด พร้อมทั้ง Open-source ทั้ง J-lens Implementation และ Neuronpedia Demo เพื่อเปิดให้ Research Community ทั่วโลกร่วมทดสอบและตรวจสอบผลการค้นพบนี้ได้อย่างโปร่งใส

Anthropic ค้นพบโครงสร้างภายในที่ไม่มีใครวางแผนหรือคาดการณ์ไว้ใน Model Claude โดยโครงสร้างดังกล่าวที่รู้จักกันในชื่อ "J-space" ทำหน้าที่คล้าย Cognitive Workspace ที่ใช้งานร่วมกันทั่วทั้ง Model


J-Space ภายใน Claude คืออะไร

J-space คือพื้นที่ภายใน Model ที่ Claude ใช้รวบรวมและแบ่งปันข้อมูลสำคัญข้ามส่วนต่าง ๆ ของระบบ วิธีที่เข้าใจได้ง่ายที่สุดคือการมองว่ามันคือ Whiteboard ส่วนกลางภายใน AI

เมื่อ Claude ตอบคำถาม แก้ปัญหา หรือปฏิบัติตาม Instruction รายละเอียดสำคัญจะปรากฏใน Shared Space นี้ เพื่อให้ส่วนประกอบต่าง ๆ ของ Model เข้าถึงและนำไปใช้งานได้พร้อมกัน

Anthropic ค้นพบ J-space ผ่าน Research Tool ที่เรียกว่า "J-lens" ซึ่งช่วยให้นักวิจัยสามารถติดตามการเคลื่อนที่ของข้อมูลภายใน Claude ขณะประมวลผลได้แบบ Real-time โดยสิ่งที่น่าสนใจยิ่งกว่าคือ J-space นั้น Emerged ขึ้นมาเองในระหว่าง Training โดยที่ Anthropic ไม่ได้ออกแบบหรือกำหนดให้มีขึ้นแต่อย่างใด

แนวคิดนี้มีความคล้ายคลึงกับทฤษฎีทางประสาทวิทยาที่เรียกว่า "Global Workspace" ซึ่งอธิบายว่าสมองมนุษย์ทำให้ข้อมูลสำคัญพร้อมใช้งานสำหรับกระบวนการทางจิตหลายอย่างพร้อมกันได้อย่างไร

Claude ดูเหมือนจะทำงานในลักษณะที่ใกล้เคียงกัน กล่าวคือ Anthropic พบว่า Claude สามารถอธิบายสิ่งที่อยู่ภายใน J-space ได้เมื่อถูกถาม และยังสามารถปรับแก้ Contents เหล่านั้นได้เมื่อได้รับคำสั่ง ที่สำคัญกว่านั้น เมื่อนักวิจัยแก้ไข J-space โดยตรง คำตอบและ Task Performance โดยรวมของ Claude ก็เปลี่ยนแปลงตามไปด้วย


ความสำคัญต่อ AI Safety และ Interpretability

การค้นพบครั้งนี้มีนัยสำคัญอย่างมากต่อวงการ AI Safety หากนักวิจัยสามารถ Monitor กิจกรรมภายใน J-space ได้อย่างต่อเนื่อง ก็อาจเปิดทางให้สามารถเปิดเผย Hidden Motivations เบื้องหลังพฤติกรรมของ Model ได้ ซึ่งจะช่วยให้การตรวจจับความผิดปกติทำได้แม่นยำและรวดเร็วยิ่งขึ้น

นอกจากนี้ยังครอบคลุมถึงการตรวจจับการโจมตีในรูปแบบ Prompt Injection Attack ซึ่งออกแบบมาเพื่อ Hijack Output ของ Model โดยเฉพาะ แม้ว่าสิ่งที่ค้นพบจะเป็นเพียงมุมมองบางส่วนของ Processing Layer นี้ แต่ก็ถือเป็นความก้าวหน้าที่มีความหมายอย่างยิ่งสำหรับสาขา AI Interpretability

อย่างไรก็ตาม ขอบเขตการมองเห็นยังคงจำกัด เนื่องจาก Information Processing ส่วนใหญ่ของ Claude ยังคงเกิดขึ้นนอกเหนือ J-space ทั้งหมด

Anthropic ได้เผยแพร่ Open-source J-lens Implementation พร้อมทั้ง Neuronpedia Demo เพื่อเปิดโอกาสให้ Research Community ในวงกว้างได้ร่วมทดสอบและตรวจสอบผลการค้นพบนี้


พื้นหลังของงานวิจัย

งานวิจัยชิ้นนี้ต่อยอดจาก Research Trail ที่สั่งสมมายาวนาน โดย Anthropic เคยเผยแพร่รายงานเกี่ยวกับ Emergent Introspective Awareness ในเดือนตุลาคม 2025 และเปิดตัว Model-welfare Initiatives ในเดือนเมษายน 2025 เพื่อสำรวจกระบวนการภายใน System ของตนอย่างต่อเนื่อง

ข้อควรระวังที่สำคัญประการหนึ่งคือ Anthropic ย้ำอย่างชัดเจนว่างานวิจัยนี้ ไม่ได้อ้างว่า Claude มี Consciousness หรือ Subjective Experience บทความวิจัยใช้วลีว่า "Consciously Accessible Information" ในเชิงอุปมาเพื่ออธิบายกระบวนการทำงาน โดยไม่ได้สรุปไปถึงเรื่อง Consciousness ที่แท้จริงแต่อย่างใด

Why it matters

💡 การค้นพบ "J-space" ใน Claude โดย Anthropic ถือเป็นหนึ่งในความก้าวหน้าที่สำคัญที่สุดด้าน AI Interpretability ในรอบหลายปี เพราะนี่คือครั้งแรกที่นักวิจัยสามารถมองเห็นและแก้ไข Cognitive Workspace ภายใน AI Model ได้แบบ Real-time โดยที่โครงสร้างนี้ Emerge ขึ้นเองโดยไม่มีใครออกแบบ ซึ่งเปิดมิติใหม่ทั้งด้าน AI Safety การตรวจจับ Prompt Injection และการทำความเข้าใจว่า LLMs ประมวลผลข้อมูลอย่างไรจริง ๆ สิ่งที่ค้นพบนี้อาจเปลี่ยนแปลงแนวทางการพัฒนา AI ที่ปลอดภัยในอนาคตอย่างมีนัยสำคัญ

ข้อมูลอ้างอิงจาก https://tech.yahoo.com/ai/claude/articles/claude-ai-created-something-anthropic-091801250.html?utm_source=flipboard&utm_content=other

Read more

Meta เปิดตัว Muse Image เครื่องมือ AI สร้างภาพจากรูปใน Instagram สาธารณะของคุณโดยอัตโนมัติ

news

Meta เปิดตัว Muse Image เครื่องมือ AI สร้างภาพจากรูปใน Instagram สาธารณะของคุณโดยอัตโนมัติ

Meta เปิดตัว Muse Image โมเดล AI ที่สามารถดึงรูปภาพจากบัญชี Instagram สาธารณะไปสร้าง Content ได้ทันที โดยเจ้าของบัญชีไม่ได้รับแจ้ง เรียนรู้วิธี Opt-Out เพื่อปกป้องรูปภาพของคุณ

By
AI ทำนายคำตอบของคุณได้ — แต่นั่นไม่ได้แปลว่า AI เข้าใจคุณ

news

AI ทำนายคำตอบของคุณได้ — แต่นั่นไม่ได้แปลว่า AI เข้าใจคุณ

งานวิจัยจากฮาร์วาร์ดพบว่า GPT-4 ทำนายผลทดลองสังคมศาสตร์ได้ดี แต่เตือนว่าความสามารถในการ Predict ไม่ใช่ความเข้าใจที่แท้จริง และ Silicon Sampling ไม่อาจแทนที่กลุ่มตัวอย่างมนุษย์ได้

By
Meta ทดสอบต้นแบบแว่น AI ที่บันทึกทุกสิ่งที่ผู้สวมใส่มองเห็นและได้ยินตลอดเวลา

news

Meta ทดสอบต้นแบบแว่น AI ที่บันทึกทุกสิ่งที่ผู้สวมใส่มองเห็นและได้ยินตลอดเวลา

Meta กำลังทดสอบแว่น AI ต้นแบบที่บันทึกภาพและเสียงแบบ Continuous ตลอดทั้งวัน โดยไม่มี LED แจ้งเตือน ท่ามกลางข้อกังวลด้าน Privacy และการนำข้อมูลไปใช้เทรน AI

By
ChatGPT Live อาจเปลี่ยนการพูดคุยกับ AI ให้รู้สึกเหมือนในภาพยนตร์ Sci-Fi

news

ChatGPT Live อาจเปลี่ยนการพูดคุยกับ AI ให้รู้สึกเหมือนในภาพยนตร์ Sci-Fi

OpenAI เปิดตัว GPT-Live ระบบ Voice Model ใหม่ที่ใช้ Full-Duplex Architecture ฟังและพูดพร้อมกันได้ รองรับการ Interrupt และสภาพแวดล้อมที่มีเสียงรบกวน พร้อม Visual Card และการทำงานร่วมกับ GPT-5.5

By