บริษัท AI แห่กว้านซื้อหนังสือเก่า หลังข้อมูลออนไลน์ปนเปื้อน AI-Generated Content
วงการ AI เผชิญวิกฤต Data Quality จากเนื้อหา AI-Generated ท่วมอินเทอร์เน็ต บริษัทจึงหันมากว้านซื้อหนังสือพิมพ์ก่อนปี 2022 ที่ปลอดการปนเปื้อน พร้อมเผชิญประเด็น Copyright และ Data Poisoning ที่ซับซ้อน
Key takeaway
- วงการ AI กำลังเผชิญวิกฤต Model Collapse เนื่องจาก AI-Generated Content ปนเปื้อนใน Open Web มากขึ้นเรื่อยๆ จนข้อมูลที่ใช้ Train Model ในอนาคตสูญเสียความบริสุทธิ์ บริษัทต่างๆ จึงหันมากว้านซื้อหนังสือที่พิมพ์ก่อนปี 2022 ซึ่งถือเป็น Fixed Human-Authored Record ที่ปลอดจาก AI-Generated Text อย่างแน่นอน
- ภัยคุกคามจาก Data Poisoning ผ่านเครื่องมืออย่าง Nightshade ทำให้ Online Data ยิ่งไม่น่าไว้วางใจ โดยงานวิจัยของ Anthropic ชี้ว่าเอกสารที่ถูก Craft มาเพียง 250–500 ชิ้น ก็เพียงพอจะฝัง Backdoor ลงใน Training Corpus ขนาด Trillion Token ได้ หนังสือพิมพ์จึงกลายเป็นสินทรัพย์ที่มี Provenance และ Chain of Custody ชัดเจน
- มิติด้าน Copyright และ Legal Framework กำลังถูก Reshape อย่างมีนัยสำคัญ หลังศาลสหรัฐฯ ตัดสินว่าการ Train บน Purchased Scanned Books ถือเป็น Fair Use ส่งผลให้การ "ซื้อและทำลาย" หนังสือฉบับพิมพ์กลายเป็นเส้นทาง Legal ที่ได้รับการรับรองจากศาล แม้จะมี Optics Problem ที่ต้องบริหารจัดการอย่างระมัดระวัง
วงการ AI กำลังเผชิญกับวิกฤต Data Quality ที่บริษัทเหล่านี้สร้างขึ้นเอง เมื่อเนื้อหาบนอินเทอร์เน็ตส่วนใหญ่ถูกสร้างขึ้นโดย Machine จน Model เสี่ยงต่อภาวะที่เรียกว่า Model Collapse หรือการที่ระบบ AI ป้อนข้อมูลที่ผลิตจาก AI ด้วยกันเองซ้ำวนไปเรื่อยๆ จนคุณภาพเสื่อมถอยลงในทุก Generation
Data Broker รายหนึ่งชื่อ ISBNdb ซึ่งอ้างตัวเองว่าเป็น Book Database ที่ใหญ่ที่สุดในโลก ได้เสนอทางออกอย่างตรงไปตรงมาว่า "Training Data ที่ดีที่สุดในโลกกำลังนั่งอยู่บนชั้นหนังสือ" โดยบริษัทได้เริ่มจัดหาหนังสือฉบับพิมพ์จริงในปริมาณมาก เพื่อให้ AI Labs นำไปสแกนเป็น Training Dataset ตามที่ 404 Media รายงาน
ทำไมต้องเป็นหนังสือเก่า?
จุดแข็งอยู่ที่ Timestamp ของข้อมูล ISBNdb ระบุว่าหนังสือที่พิมพ์ก่อนปี 2022 นั้นถือกำเนิดขึ้นก่อนยุค LLM (Large Language Model) จึงปลอดจาก AI-Generated Text อย่างแน่นอน และยังมีคุณสมบัติครบถ้วนในฐานะ Training Data คือเป็นข้อมูลที่ "Dense, Edited และ Authoritative"
ในขณะที่ Open Web ไม่สามารถรับประกันความบริสุทธิ์ของข้อมูลได้อีกต่อไป เนื่องจาก Machine-Generated Content หลั่งไหลเข้าสู่ระบบในสัดส่วนที่เพิ่มขึ้นอย่างรวดเร็ว หนังสือที่พิมพ์ก่อนปี 2022 จึงถือเป็น Fixed Human-Authored Record ที่ไม่มีใครสามารถแก้ไขได้ย้อนหลัง
ภัยคุกคามจาก Data Poisoning
อีกเหตุผลสำคัญที่ทำให้ AI Labs หันมาสนใจสื่อสิ่งพิมพ์ คือการที่นักเขียนและศิลปินเริ่มต่อสู้กลับด้วยเทคนิค Data Poisoning โดยอาศัยเครื่องมืออย่าง Nightshade ซึ่งแฝง Character พิเศษลงในข้อความที่มนุษย์อ่านได้ตามปกติ แต่ทำให้ Model ประมวลผลผิดพลาด
งานวิจัยของ Anthropic ที่ ISBNdb อ้างอิงในบล็อกของตนระบุว่า เพียงแค่ 250 ถึง 500 เอกสาร ที่ถูก Craft มาอย่างแม่นยำ ก็เพียงพอที่จะฝัง Backdoor ลงใน Corpus ขนาดหลาย Trillion Token ได้
หนังสือที่พิมพ์ก่อนยุค Data Poisoning จึงกลายเป็นสินทรัพย์ที่มี Provenance ชัดเจน พร้อม Chain of Custody ที่ Legal Team ของ AI Labs สามารถยึดถือได้ในกรณีพิพาท
ปัญหาด้าน Optics และข้อตกลง NDA
อย่างไรก็ตาม กระบวนการนี้มีต้นทุนที่ซ่อนอยู่ การสแกนในระดับ Scale มักหมายถึงการทำลายหนังสือทิ้ง เนื่องจากพนักงานต้องตัดสันหนังสือออกเพื่อให้สามารถป้อนหน้ากระดาษเข้าเครื่องสแกนได้อย่างรวดเร็วและประหยัดต้นทุน
ISBNdb จึงเสนอบริการรักษาความลับให้แก่ลูกค้า ด้วย "Strict NDA on Every Engagement" โดยไม่มีการเปิดเผยชื่อผู้ซื้อไม่ว่ากรณีใด เหตุผลที่บริษัทระบุไว้อย่างตรงไปตรงมาในหน้า Marketing ของตนเองว่า "The Optics Problem is Real" และพาดหัวข่าวอย่าง 'AI Company Destroys Two Million Books' นั้นย่อมไม่สร้าง Sympathy ให้กับใครทั้งนั้น
หนึ่งในวิธีบริหารจัดการภาพลักษณ์ที่ ISBNdb แนะนำ คือการ Reframe การกระทำดังกล่าวให้กลายเป็นการ "Digitally Preserving" หนังสือแทน
มิติด้าน Copyright และคำตัดสินของศาล
ประเด็นนี้ยังโยงตรงสู่สมรภูมิ Copyright ที่กำลังดุเดือด โดยศาลสหรัฐฯ ได้อนุมัติ Settlement มูลค่า 1.5 พันล้านดอลลาร์ ของ Anthropic ในคดีที่เกี่ยวกับหนังสือที่ละเมิดลิขสิทธิ์ และยังตัดสินด้วยว่าการ Train บน Purchased Scanned Books ถือเป็น Fair Use ส่วนหนึ่งของเหตุผลคือกระบวนการ Scanning ได้ทำลาย Print Original ไปแล้ว ซึ่งหมายความว่า Legal Copy หนึ่งชุดเพียงแค่ถูกแทนที่ด้วยรูปแบบใหม่เท่านั้น
การ ซื้อและทำลาย สำเนาฉบับพิมพ์จึงกลายเป็นเส้นทางที่ได้รับการรับรองจากศาล
ในขณะเดียวกัน Ingram ผู้จัดจำหน่ายหนังสือรายใหญ่ที่สุดในสหรัฐฯ ก็ได้ออกมาแจ้งเตือนสำนักพิมพ์ต่างๆ และเปิดช่องทาง Opt-Out ให้เป็นที่เรียบร้อยแล้ว
สิ่งที่หายากที่สุดในโลก AI ณ วันนี้ กลับกลายเป็นเรื่องเรียบง่าย นั่นคือ "ประโยคที่ไม่เคยถูก Machine แตะต้องมาก่อนเลยแม้แต่ครั้งเดียว"
Why it matters
💡 วงการ AI กำลังเผชิญวิกฤตที่สร้างขึ้นด้วยมือตัวเอง เมื่อข้อมูลออนไลน์ปนเปื้อน AI-Generated Content จนเสี่ยงเกิด Model Collapse บริษัท AI ชั้นนำจึงหันมากว้านซื้อหนังสือที่พิมพ์ก่อนปี 2022 ซึ่งเป็น Training Data บริสุทธิ์ที่ปลอดจากการแทรกแซงของ Machine นักพัฒนาและผู้บริหารด้าน AI ควรติดตามข่าวนี้อย่างใกล้ชิด เพราะมันสะท้อนทิศทางอนาคตของ Data Strategy, ปัญหา Copyright และ Data Poisoning ที่กำลังเปลี่ยนโฉมหน้าอุตสาหกรรมอย่างถาวร
ข้อมูลอ้างอิงจาก https://thenextweb.com/news/ai-companies-buying-old-books-training-data-slop