บริษัท AI แห่กว้านซื้อหนังสือเก่า หลังข้อมูลออนไลน์ปนเปื้อน AI-Generated Content

วงการ AI เผชิญวิกฤต Data Quality จากเนื้อหา AI-Generated ท่วมอินเทอร์เน็ต บริษัทจึงหันมากว้านซื้อหนังสือพิมพ์ก่อนปี 2022 ที่ปลอดการปนเปื้อน พร้อมเผชิญประเด็น Copyright และ Data Poisoning ที่ซับซ้อน

บริษัท AI แห่กว้านซื้อหนังสือเก่า หลังข้อมูลออนไลน์ปนเปื้อน AI-Generated Content

Key takeaway

  • วงการ AI กำลังเผชิญวิกฤต Model Collapse เนื่องจาก AI-Generated Content ปนเปื้อนใน Open Web มากขึ้นเรื่อยๆ จนข้อมูลที่ใช้ Train Model ในอนาคตสูญเสียความบริสุทธิ์ บริษัทต่างๆ จึงหันมากว้านซื้อหนังสือที่พิมพ์ก่อนปี 2022 ซึ่งถือเป็น Fixed Human-Authored Record ที่ปลอดจาก AI-Generated Text อย่างแน่นอน
  • ภัยคุกคามจาก Data Poisoning ผ่านเครื่องมืออย่าง Nightshade ทำให้ Online Data ยิ่งไม่น่าไว้วางใจ โดยงานวิจัยของ Anthropic ชี้ว่าเอกสารที่ถูก Craft มาเพียง 250–500 ชิ้น ก็เพียงพอจะฝัง Backdoor ลงใน Training Corpus ขนาด Trillion Token ได้ หนังสือพิมพ์จึงกลายเป็นสินทรัพย์ที่มี Provenance และ Chain of Custody ชัดเจน
  • มิติด้าน Copyright และ Legal Framework กำลังถูก Reshape อย่างมีนัยสำคัญ หลังศาลสหรัฐฯ ตัดสินว่าการ Train บน Purchased Scanned Books ถือเป็น Fair Use ส่งผลให้การ "ซื้อและทำลาย" หนังสือฉบับพิมพ์กลายเป็นเส้นทาง Legal ที่ได้รับการรับรองจากศาล แม้จะมี Optics Problem ที่ต้องบริหารจัดการอย่างระมัดระวัง

วงการ AI กำลังเผชิญกับวิกฤต Data Quality ที่บริษัทเหล่านี้สร้างขึ้นเอง เมื่อเนื้อหาบนอินเทอร์เน็ตส่วนใหญ่ถูกสร้างขึ้นโดย Machine จน Model เสี่ยงต่อภาวะที่เรียกว่า Model Collapse หรือการที่ระบบ AI ป้อนข้อมูลที่ผลิตจาก AI ด้วยกันเองซ้ำวนไปเรื่อยๆ จนคุณภาพเสื่อมถอยลงในทุก Generation

Data Broker รายหนึ่งชื่อ ISBNdb ซึ่งอ้างตัวเองว่าเป็น Book Database ที่ใหญ่ที่สุดในโลก ได้เสนอทางออกอย่างตรงไปตรงมาว่า "Training Data ที่ดีที่สุดในโลกกำลังนั่งอยู่บนชั้นหนังสือ" โดยบริษัทได้เริ่มจัดหาหนังสือฉบับพิมพ์จริงในปริมาณมาก เพื่อให้ AI Labs นำไปสแกนเป็น Training Dataset ตามที่ 404 Media รายงาน


ทำไมต้องเป็นหนังสือเก่า?

จุดแข็งอยู่ที่ Timestamp ของข้อมูล ISBNdb ระบุว่าหนังสือที่พิมพ์ก่อนปี 2022 นั้นถือกำเนิดขึ้นก่อนยุค LLM (Large Language Model) จึงปลอดจาก AI-Generated Text อย่างแน่นอน และยังมีคุณสมบัติครบถ้วนในฐานะ Training Data คือเป็นข้อมูลที่ "Dense, Edited และ Authoritative"

ในขณะที่ Open Web ไม่สามารถรับประกันความบริสุทธิ์ของข้อมูลได้อีกต่อไป เนื่องจาก Machine-Generated Content หลั่งไหลเข้าสู่ระบบในสัดส่วนที่เพิ่มขึ้นอย่างรวดเร็ว หนังสือที่พิมพ์ก่อนปี 2022 จึงถือเป็น Fixed Human-Authored Record ที่ไม่มีใครสามารถแก้ไขได้ย้อนหลัง


ภัยคุกคามจาก Data Poisoning

อีกเหตุผลสำคัญที่ทำให้ AI Labs หันมาสนใจสื่อสิ่งพิมพ์ คือการที่นักเขียนและศิลปินเริ่มต่อสู้กลับด้วยเทคนิค Data Poisoning โดยอาศัยเครื่องมืออย่าง Nightshade ซึ่งแฝง Character พิเศษลงในข้อความที่มนุษย์อ่านได้ตามปกติ แต่ทำให้ Model ประมวลผลผิดพลาด

งานวิจัยของ Anthropic ที่ ISBNdb อ้างอิงในบล็อกของตนระบุว่า เพียงแค่ 250 ถึง 500 เอกสาร ที่ถูก Craft มาอย่างแม่นยำ ก็เพียงพอที่จะฝัง Backdoor ลงใน Corpus ขนาดหลาย Trillion Token ได้

หนังสือที่พิมพ์ก่อนยุค Data Poisoning จึงกลายเป็นสินทรัพย์ที่มี Provenance ชัดเจน พร้อม Chain of Custody ที่ Legal Team ของ AI Labs สามารถยึดถือได้ในกรณีพิพาท


ปัญหาด้าน Optics และข้อตกลง NDA

อย่างไรก็ตาม กระบวนการนี้มีต้นทุนที่ซ่อนอยู่ การสแกนในระดับ Scale มักหมายถึงการทำลายหนังสือทิ้ง เนื่องจากพนักงานต้องตัดสันหนังสือออกเพื่อให้สามารถป้อนหน้ากระดาษเข้าเครื่องสแกนได้อย่างรวดเร็วและประหยัดต้นทุน

ISBNdb จึงเสนอบริการรักษาความลับให้แก่ลูกค้า ด้วย "Strict NDA on Every Engagement" โดยไม่มีการเปิดเผยชื่อผู้ซื้อไม่ว่ากรณีใด เหตุผลที่บริษัทระบุไว้อย่างตรงไปตรงมาในหน้า Marketing ของตนเองว่า "The Optics Problem is Real" และพาดหัวข่าวอย่าง 'AI Company Destroys Two Million Books' นั้นย่อมไม่สร้าง Sympathy ให้กับใครทั้งนั้น

หนึ่งในวิธีบริหารจัดการภาพลักษณ์ที่ ISBNdb แนะนำ คือการ Reframe การกระทำดังกล่าวให้กลายเป็นการ "Digitally Preserving" หนังสือแทน


ประเด็นนี้ยังโยงตรงสู่สมรภูมิ Copyright ที่กำลังดุเดือด โดยศาลสหรัฐฯ ได้อนุมัติ Settlement มูลค่า 1.5 พันล้านดอลลาร์ ของ Anthropic ในคดีที่เกี่ยวกับหนังสือที่ละเมิดลิขสิทธิ์ และยังตัดสินด้วยว่าการ Train บน Purchased Scanned Books ถือเป็น Fair Use ส่วนหนึ่งของเหตุผลคือกระบวนการ Scanning ได้ทำลาย Print Original ไปแล้ว ซึ่งหมายความว่า Legal Copy หนึ่งชุดเพียงแค่ถูกแทนที่ด้วยรูปแบบใหม่เท่านั้น

การ ซื้อและทำลาย สำเนาฉบับพิมพ์จึงกลายเป็นเส้นทางที่ได้รับการรับรองจากศาล

ในขณะเดียวกัน Ingram ผู้จัดจำหน่ายหนังสือรายใหญ่ที่สุดในสหรัฐฯ ก็ได้ออกมาแจ้งเตือนสำนักพิมพ์ต่างๆ และเปิดช่องทาง Opt-Out ให้เป็นที่เรียบร้อยแล้ว

สิ่งที่หายากที่สุดในโลก AI ณ วันนี้ กลับกลายเป็นเรื่องเรียบง่าย นั่นคือ "ประโยคที่ไม่เคยถูก Machine แตะต้องมาก่อนเลยแม้แต่ครั้งเดียว"

Why it matters

💡 วงการ AI กำลังเผชิญวิกฤตที่สร้างขึ้นด้วยมือตัวเอง เมื่อข้อมูลออนไลน์ปนเปื้อน AI-Generated Content จนเสี่ยงเกิด Model Collapse บริษัท AI ชั้นนำจึงหันมากว้านซื้อหนังสือที่พิมพ์ก่อนปี 2022 ซึ่งเป็น Training Data บริสุทธิ์ที่ปลอดจากการแทรกแซงของ Machine นักพัฒนาและผู้บริหารด้าน AI ควรติดตามข่าวนี้อย่างใกล้ชิด เพราะมันสะท้อนทิศทางอนาคตของ Data Strategy, ปัญหา Copyright และ Data Poisoning ที่กำลังเปลี่ยนโฉมหน้าอุตสาหกรรมอย่างถาวร

ข้อมูลอ้างอิงจาก https://thenextweb.com/news/ai-companies-buying-old-books-training-data-slop

Read more

ChatGPT สามารถเชื่อมต่อกับข้อมูล Apple Health ของคุณเพื่อให้คำตอบด้านสุขภาพที่เป็นส่วนตัวมากขึ้น

news

ChatGPT สามารถเชื่อมต่อกับข้อมูล Apple Health ของคุณเพื่อให้คำตอบด้านสุขภาพที่เป็นส่วนตัวมากขึ้น

OpenAI เปิดตัว Health in ChatGPT ให้ผู้ใช้ในสหรัฐฯ เชื่อมต่อข้อมูล Apple Health และเวชระเบียนได้อย่างปลอดภัย เพื่อรับคำแนะนำสุขภาพที่มีบริบทเฉพาะบุคคล พร้อมให้ผู้ใช้ควบคุมสิทธิ์การเข้าถึงข้อมูลได้ด้วยตนเอง

By
Google ล่าช้ากว่ากำหนดในการเปิดตัว Gemini 3.5 Pro เนื่องจากปัญหาด้าน Coding Performance

news

Google ล่าช้ากว่ากำหนดในการเปิดตัว Gemini 3.5 Pro เนื่องจากปัญหาด้าน Coding Performance

Google ล่าช้ากว่า Internal Schedule หลายเดือนในการเปิดตัว Gemini 3.5 Pro เนื่องจากปัญหาด้าน Coding Performance ที่ยังไม่ผ่านเกณฑ์ ท่ามกลางการแข่งขัน AI ที่คู่แข่งอย่าง OpenAI และ Meta เดินหน้าอย่างไม่หยุดยั้ง

By
นักวิทยาศาสตร์ใช้ AI และ Quantum Computing สร้าง Peptide ชนิดใหม่ในเวลาว่าง

news

นักวิทยาศาสตร์ใช้ AI และ Quantum Computing สร้าง Peptide ชนิดใหม่ในเวลาว่าง

ทีมวิจัยจาก DTU ผสาน Quantum Computing กับ Generative AI สร้าง Novel Peptide ชนิดใหม่สำเร็จในช่วงเวลาว่าง เปิดทางพัฒนาวัคซีนและ Personalized Immunotherapy โดยเฉพาะกลุ่มประชากรที่ขาดข้อมูลการวิจัย

By
Fujitsu และบริษัทหุ่นยนต์ชั้นนำของญี่ปุ่นจับมือ Nvidia พัฒนา 'Physical AI' รับมือวิกฤตแรงงาน

news

Fujitsu และบริษัทหุ่นยนต์ชั้นนำของญี่ปุ่นจับมือ Nvidia พัฒนา 'Physical AI' รับมือวิกฤตแรงงาน

Fujitsu จับมือ Nvidia พร้อมผู้ผลิตหุ่นยนต์ชั้นนำอย่าง Fanuc, Yaskawa และ Kawasaki พัฒนา Physical AI เพื่อแก้ปัญหาขาดแคลนแรงงานในญี่ปุ่น โดย Phase แรกจะเริ่มต้นปลายปีนี้

By