Claude AI สร้างโครงสร้างภายในที่ Anthropic ไม่เคยออกแบบ

Anthropic ค้นพบ J-space โครงสร้างภายใน Claude ที่ไม่มีใครออกแบบ ทำหน้าที่เป็น Cognitive Workspace กลางของ Model เปิดศักยภาพใหม่ด้าน AI Safety และ Interpretability

Claude AI สร้างโครงสร้างภายในที่ Anthropic ไม่เคยออกแบบ

Key takeaway

  • Anthropic ค้นพบโครงสร้างภายในที่เรียกว่า "J-space" ใน Claude ซึ่ง Emerge ขึ้นเองโดยไม่ได้ถูกออกแบบมาตั้งแต่ต้น โดยทำหน้าที่เป็น Shared Cognitive Workspace ที่ช่วยให้ส่วนประกอบต่าง ๆ ของ Model แชร์และเข้าถึงข้อมูลสำคัญร่วมกันได้แบบ Real-time คล้ายกับทฤษฎี Global Workspace ในประสาทวิทยาศาสตร์
  • การค้นพบนี้มีนัยสำคัญต่อด้าน AI Safety และ Interpretability อย่างมาก เพราะการ Monitor J-space ผ่าน Tool ที่ชื่อ J-lens เปิดโอกาสให้นักวิจัยสามารถตรวจจับ Hidden Motivations, พฤติกรรมผิดปกติ และการโจมตีแบบ Prompt Injection ได้แม่นยำขึ้น แม้ว่า Information Processing ส่วนใหญ่ของ Claude ยังคงเกิดขึ้นนอกเหนือ J-space อยู่
  • Anthropic เน้นย้ำชัดเจนว่างานวิจัยนี้ไม่ได้อ้างถึง Consciousness หรือ Subjective Experience ของ Claude แต่อย่างใด พร้อมทั้ง Open-source ทั้ง J-lens Implementation และ Neuronpedia Demo เพื่อเปิดให้ Research Community ทั่วโลกร่วมทดสอบและตรวจสอบผลการค้นพบนี้ได้อย่างโปร่งใส

Anthropic ค้นพบโครงสร้างภายในที่ไม่มีใครวางแผนหรือคาดการณ์ไว้ใน Model Claude โดยโครงสร้างดังกล่าวที่รู้จักกันในชื่อ "J-space" ทำหน้าที่คล้าย Cognitive Workspace ที่ใช้งานร่วมกันทั่วทั้ง Model


J-Space ภายใน Claude คืออะไร

J-space คือพื้นที่ภายใน Model ที่ Claude ใช้รวบรวมและแบ่งปันข้อมูลสำคัญข้ามส่วนต่าง ๆ ของระบบ วิธีที่เข้าใจได้ง่ายที่สุดคือการมองว่ามันคือ Whiteboard ส่วนกลางภายใน AI

เมื่อ Claude ตอบคำถาม แก้ปัญหา หรือปฏิบัติตาม Instruction รายละเอียดสำคัญจะปรากฏใน Shared Space นี้ เพื่อให้ส่วนประกอบต่าง ๆ ของ Model เข้าถึงและนำไปใช้งานได้พร้อมกัน

Anthropic ค้นพบ J-space ผ่าน Research Tool ที่เรียกว่า "J-lens" ซึ่งช่วยให้นักวิจัยสามารถติดตามการเคลื่อนที่ของข้อมูลภายใน Claude ขณะประมวลผลได้แบบ Real-time โดยสิ่งที่น่าสนใจยิ่งกว่าคือ J-space นั้น Emerged ขึ้นมาเองในระหว่าง Training โดยที่ Anthropic ไม่ได้ออกแบบหรือกำหนดให้มีขึ้นแต่อย่างใด

แนวคิดนี้มีความคล้ายคลึงกับทฤษฎีทางประสาทวิทยาที่เรียกว่า "Global Workspace" ซึ่งอธิบายว่าสมองมนุษย์ทำให้ข้อมูลสำคัญพร้อมใช้งานสำหรับกระบวนการทางจิตหลายอย่างพร้อมกันได้อย่างไร

Claude ดูเหมือนจะทำงานในลักษณะที่ใกล้เคียงกัน กล่าวคือ Anthropic พบว่า Claude สามารถอธิบายสิ่งที่อยู่ภายใน J-space ได้เมื่อถูกถาม และยังสามารถปรับแก้ Contents เหล่านั้นได้เมื่อได้รับคำสั่ง ที่สำคัญกว่านั้น เมื่อนักวิจัยแก้ไข J-space โดยตรง คำตอบและ Task Performance โดยรวมของ Claude ก็เปลี่ยนแปลงตามไปด้วย


ความสำคัญต่อ AI Safety และ Interpretability

การค้นพบครั้งนี้มีนัยสำคัญอย่างมากต่อวงการ AI Safety หากนักวิจัยสามารถ Monitor กิจกรรมภายใน J-space ได้อย่างต่อเนื่อง ก็อาจเปิดทางให้สามารถเปิดเผย Hidden Motivations เบื้องหลังพฤติกรรมของ Model ได้ ซึ่งจะช่วยให้การตรวจจับความผิดปกติทำได้แม่นยำและรวดเร็วยิ่งขึ้น

นอกจากนี้ยังครอบคลุมถึงการตรวจจับการโจมตีในรูปแบบ Prompt Injection Attack ซึ่งออกแบบมาเพื่อ Hijack Output ของ Model โดยเฉพาะ แม้ว่าสิ่งที่ค้นพบจะเป็นเพียงมุมมองบางส่วนของ Processing Layer นี้ แต่ก็ถือเป็นความก้าวหน้าที่มีความหมายอย่างยิ่งสำหรับสาขา AI Interpretability

อย่างไรก็ตาม ขอบเขตการมองเห็นยังคงจำกัด เนื่องจาก Information Processing ส่วนใหญ่ของ Claude ยังคงเกิดขึ้นนอกเหนือ J-space ทั้งหมด

Anthropic ได้เผยแพร่ Open-source J-lens Implementation พร้อมทั้ง Neuronpedia Demo เพื่อเปิดโอกาสให้ Research Community ในวงกว้างได้ร่วมทดสอบและตรวจสอบผลการค้นพบนี้


พื้นหลังของงานวิจัย

งานวิจัยชิ้นนี้ต่อยอดจาก Research Trail ที่สั่งสมมายาวนาน โดย Anthropic เคยเผยแพร่รายงานเกี่ยวกับ Emergent Introspective Awareness ในเดือนตุลาคม 2025 และเปิดตัว Model-welfare Initiatives ในเดือนเมษายน 2025 เพื่อสำรวจกระบวนการภายใน System ของตนอย่างต่อเนื่อง

ข้อควรระวังที่สำคัญประการหนึ่งคือ Anthropic ย้ำอย่างชัดเจนว่างานวิจัยนี้ ไม่ได้อ้างว่า Claude มี Consciousness หรือ Subjective Experience บทความวิจัยใช้วลีว่า "Consciously Accessible Information" ในเชิงอุปมาเพื่ออธิบายกระบวนการทำงาน โดยไม่ได้สรุปไปถึงเรื่อง Consciousness ที่แท้จริงแต่อย่างใด

Why it matters

💡 การค้นพบ "J-space" ใน Claude โดย Anthropic ถือเป็นหนึ่งในความก้าวหน้าที่สำคัญที่สุดด้าน AI Interpretability ในรอบหลายปี เพราะนี่คือครั้งแรกที่นักวิจัยสามารถมองเห็นและแก้ไข Cognitive Workspace ภายใน AI Model ได้แบบ Real-time โดยที่โครงสร้างนี้ Emerge ขึ้นเองโดยไม่มีใครออกแบบ ซึ่งเปิดมิติใหม่ทั้งด้าน AI Safety การตรวจจับ Prompt Injection และการทำความเข้าใจว่า LLMs ประมวลผลข้อมูลอย่างไรจริง ๆ สิ่งที่ค้นพบนี้อาจเปลี่ยนแปลงแนวทางการพัฒนา AI ที่ปลอดภัยในอนาคตอย่างมีนัยสำคัญ

ข้อมูลอ้างอิงจาก https://tech.yahoo.com/ai/claude/articles/claude-ai-created-something-anthropic-091801250.html?utm_source=flipboard&utm_content=other

Read more

AI เริ่มถอดรหัสภาษาสัตว์ และสิ่งที่ค้นพบนั้นน่าทึ่งเกินคาด

news

AI เริ่มถอดรหัสภาษาสัตว์ และสิ่งที่ค้นพบนั้นน่าทึ่งเกินคาด

AI สามารถถอดรหัสการสื่อสารของสัตว์ได้แล้ว ทั้งเสียงนกกา นกร้องเพลง และวาฬสเปิร์ม แต่นักวิจัยเตือนว่าการวิเคราะห์เสียงอย่างเดียวไม่เพียงพอ และการ "โต้ตอบ" กับสัตว์อาจรบกวนระบบนิเวศได้

By
OpenAI เรียกร้องจัดตั้งมาตรฐาน AI Safety ระดับนานาชาติ ชี้โลกต้องร่วมมือรับมือความเสี่ยง

news

OpenAI เรียกร้องจัดตั้งมาตรฐาน AI Safety ระดับนานาชาติ ชี้โลกต้องร่วมมือรับมือความเสี่ยง

OpenAI เรียกร้องให้นานาชาติร่วมกำหนดมาตรฐาน AI Safety ระดับสากล พร้อมผลักดัน Alignment Research ขณะที่ CIO ถูกแนะนำให้ตั้ง Bar ความปลอดภัยภายในองค์กรให้สูงกว่ามาตรฐานโลก

By
Anthropic เตรียมเปิดตัว Claude Money ฟีเจอร์วิเคราะห์ข้อมูลทางการเงินส่วนตัว

news

Anthropic เตรียมเปิดตัว Claude Money ฟีเจอร์วิเคราะห์ข้อมูลทางการเงินส่วนตัว

Anthropic เตรียมเปิดตัวฟีเจอร์ Claude Money บน iOS ให้ผู้ใช้เชื่อมบัญชีธนาคารเพื่อวิเคราะห์การใช้จ่ายและการเงินส่วนตัวด้วย AI คล้ายกับฟีเจอร์ Finances ของ ChatGPT

By
OpenAI เปิดตัว ChatGPT for Financial Services ดึงข้อมูลวิจัย อ้างอิงแหล่งที่มา และสร้าง Deck ได้ภายในไม่กี่นาที

news

OpenAI เปิดตัว ChatGPT for Financial Services ดึงข้อมูลวิจัย อ้างอิงแหล่งที่มา และสร้าง Deck ได้ภายในไม่กี่นาที

OpenAI เปิดตัว ChatGPT for Financial Services บน GPT-6 Astra ผสานข้อมูลจาก PitchBook, S&P และ FactSet กว่า 50 Integrations ช่วย Banker สร้าง Pitchbook และ Valuation Model ได้ในไม่กี่นาที

By