Wikipedia มอบข้อมูลให้ผู้พัฒนา AI เพื่อป้องกันบอทคัดลอกข้อมูล

วิกิพีเดียจับมือ Kaggle เปิดตัวชุดข้อมูลภาษาอังกฤษและฝรั่งเศสสำหรับพัฒนา AI โดยเฉพาะ เพื่อป้องกันการสแกรปข้อมูลที่สร้างภาระให้เซิร์ฟเวอร์ ช่วยให้นักพัฒนาเข้าถึงข้อมูลได้สะดวกขึ้น

Wikipedia มอบข้อมูลให้ผู้พัฒนา AI เพื่อป้องกันบอทคัดลอกข้อมูล

Key takeaway

  • วิกิพีเดียร่วมมือกับ Kaggle เปิดตัวชุดข้อมูลที่ออกแบบมาเฉพาะสำหรับการเทรนโมเดล AI โดยมีเนื้อหาที่มีโครงสร้างในภาษาอังกฤษและฝรั่งเศส เพื่อป้องกันการสแกรปข้อมูลจากบอท AI ที่สร้างภาระให้กับเซิร์ฟเวอร์
  • ชุดข้อมูลนี้อยู่ในรูปแบบ JSON ที่มีโครงสร้างชัดเจน ประกอบด้วยบทสรุปงานวิจัย คำอธิบายสั้นๆ ลิงก์รูปภาพ ข้อมูล infobox และส่วนต่างๆ ของบทความ ซึ่งเหมาะสำหรับการนำไปใช้ในงาน machine learning
  • การร่วมมือครั้งนี้จะช่วยให้บริษัทขนาดเล็กและนักวิทยาศาสตร์ข้อมูลอิสระสามารถเข้าถึงข้อมูลได้ง่ายขึ้น โดยไม่ต้องพึ่งพาการสแกรปข้อมูลแบบดั้งเดิมที่อาจสร้างปัญหาให้กับระบบ

วิกิพีเดียกำลังดำเนินการยับยั้งนักพัฒนาปัญญาประดิษฐ์จากการสแกรปแพลตฟอร์มด้วยการเปิดตัวชุดข้อมูลที่ออกแบบมาโดยเฉพาะสำหรับการเทรนโมเดล AI มูลนิธิวิกิมีเดียได้ประกาศเมื่อวันพุธที่ผ่านมาว่า ได้ร่วมมือกับ Kaggle — แพลตฟอร์มชุมชนวิทยาศาสตร์ข้อมูลที่เป็นของ Google — เพื่อเผยแพร่ชุดข้อมูลเบต้าของ "เนื้อหาวิกิพีเดียที่มีโครงสร้างในภาษาอังกฤษและฝรั่งเศส"

ทางวิกิมีเดียระบุว่า ชุดข้อมูลที่โฮสต์โดย Kaggle นี้ได้รับการ "ออกแบบโดยคำนึงถึงเวิร์กโฟลว์ของ machine learning" ซึ่งช่วยให้นักพัฒนา AI สามารถเข้าถึงข้อมูลบทความที่เครื่องอ่านได้ เพื่อนำไปใช้ในการสร้างโมเดล, การ fine-tuning, การทำ benchmarking, การ alignment และการวิเคราะห์ได้สะดวกยิ่งขึ้น เนื้อหาในชุดข้อมูลนี้มีใบอนุญาตแบบเปิด และตั้งแต่วันที่ 15 เมษายน ได้รวมบทสรุปงานวิจัย, คำอธิบายสั้นๆ, ลิงก์รูปภาพ, ข้อมูล infobox และส่วนต่างๆ ของบทความ — โดยไม่รวมการอ้างอิงหรือองค์ประกอบที่ไม่ใช่ข้อความเขียน เช่น ไฟล์เสียง

วิกิมีเดียเชื่อว่า "การนำเสนอเนื้อหาวิกิพีเดียในรูปแบบ JSON ที่มีโครงสร้างชัดเจน" ที่มอบให้กับผู้ใช้ Kaggle นั้น จะเป็นทางเลือกที่น่าดึงดูดใจมากกว่า "การสแกรปหรือแยกวิเคราะห์ข้อความบทความดิบ" — ซึ่งปัญหาดังกล่าวกำลังสร้างความตึงเครียดให้กับเซิร์ฟเวอร์ของวิกิพีเดีย เนื่องจากบอท AI อัตโนมัติใช้แบนด์วิดท์ของแพลตฟอร์มอย่างต่อเนื่อง แม้ว่าวิกิมีเดียจะมีข้อตกลงการแบ่งปันเนื้อหากับ Google และ Internet Archive อยู่แล้ว แต่ความร่วมมือกับ Kaggle ครั้งนี้จะช่วยให้ข้อมูลเหล่านั้นเข้าถึงได้ง่ายขึ้นสำหรับบริษัทขนาดเล็กและนักวิทยาศาสตร์ข้อมูลอิสระ

Brenda Flynn หัวหน้าฝ่ายพันธมิตรของ Kaggle กล่าวว่า "ในฐานะที่เป็นแหล่งที่ชุมชน machine learning มาหาเครื่องมือและทดสอบ Kaggle รู้สึกตื่นเต้นอย่างมากที่ได้เป็นโฮสต์สำหรับข้อมูลของมูลนิธิวิกิมีเดีย Kaggle รู้สึกตื่นเต้นที่ได้มีส่วนร่วมในการรักษาให้ข้อมูลนี้สามารถเข้าถึงได้ พร้อมใช้งาน และมีประโยชน์"

Why it matters

💡 ข่าวนี้มีความสำคัญอย่างยิ่งสำหรับผู้ที่สนใจด้านเทคโนโลยี AI และการพัฒนาโมเดล เพราะเป็นการเปลี่ยนแปลงครั้งสำคัญในวงการ AI ที่วิกิพีเดียได้เปิดให้เข้าถึงข้อมูลอย่างเป็นระบบผ่าน Kaggle แทนการสแกรปข้อมูลแบบเดิม ซึ่งจะช่วยให้นักพัฒนาทั้งรายใหญ่และรายย่อยสามารถนำข้อมูลไปใช้ได้อย่างมีประสิทธิภาพ ถูกต้องตามกฎหมาย และไม่สร้างภาระให้กับเซิร์ฟเวอร์ของวิกิพีเดีย

ข้อมูลอ้างอิงจาก https://www.theverge.com/news/650467/wikipedia-kaggle-partnership-ai-dataset-machine-learning

Read more

กล้องอัจฉริยะด้วย AI ของ Logitech ปฏิวัติการแสดงผลห้องประชุมขนาดใหญ่ในการประชุมวิดีโอ

news

กล้องอัจฉริยะด้วย AI ของ Logitech ปฏิวัติการแสดงผลห้องประชุมขนาดใหญ่ในการประชุมวิดีโอ

Logitech นำเสนอโซลูชันใหม่ด้วย Rally AI Camera และ Rally AI Camera Pro ที่ใช้เทคโนโลยี AI ช่วยแก้ปัญหาการประชุมในห้องขนาดใหญ่ ด้วยระบบจัดเฟรมอัจฉริยะ RightSight 2 ที่ปรับมุมมองตามสถานการณ์ เพื่อให้การประชุมแบบไฮบริดมีความเท่าเทียมมากขึ้น

By
Resolve AI ระดมทุน $125 ล้านด้วยมูลค่า $1 พันล้าน เพื่อพัฒนาระบบบำรุงรักษาแอปพลิเคชันอัตโนมัติ

news

Resolve AI ระดมทุน $125 ล้านด้วยมูลค่า $1 พันล้าน เพื่อพัฒนาระบบบำรุงรักษาแอปพลิเคชันอัตโนมัติ

Resolve AI สตาร์ทอัพที่พัฒนาแพลตฟอร์มแก้ไขปัญหาแอปพลิเคชันอัตโนมัติ ระดมทุน Series A มูลค่า $125 ล้าน จาก Lightspeed และพันธมิตร ส่งผลให้บริษัทมีมูลค่า $1 พันล้าน เงินทุนจะถูกใช้ขยายทีมและพัฒนาโมเดล AI แบบกำหนดเอง

By
นักวิจัยเผยผู้บุกรุก AWS ได้รับสิทธิ์ admin ภายในเวลาไม่ถึง 10 นาที ด้วยความช่วยเหลือจาก AI

news

นักวิจัยเผยผู้บุกรุก AWS ได้รับสิทธิ์ admin ภายในเวลาไม่ถึง 10 นาที ด้วยความช่วยเหลือจาก AI

ผู้บุกรุกใช้ AI เจาะระบบคลาวด์ AWS ได้สิทธิ์แอดมินภายในเวลาไม่ถึง 10 นาที โดยขโมย credentials จาก S3 buckets สาธารณะ ยกระดับสิทธิ์ผ่าน Lambda function และเข้าถึงทรัพยากร AI ของเหยื่อ กรณีนี้แสดงให้เห็นถึงภัยคุกคามใหม่ที่ใช้ AI ช่วยโจมตี

By
จาก Clawdbot สู่ Moltbot: AI Agent นี้ไวรัลและเปลี่ยนตัวตนใหม่ภายใน 72 ชั่วโมงได้อย่างไร

news

จาก Clawdbot สู่ Moltbot: AI Agent นี้ไวรัลและเปลี่ยนตัวตนใหม่ภายใน 72 ชั่วโมงได้อย่างไร

ติดตามเรื่องราวของ Moltbot ผู้ช่วย AI โอเพนซอร์สที่ต้องเปลี่ยนชื่อจาก Clawdbot หลังปัญหาเครื่องหมายการค้ากับ Anthropic เจ้าของ Claude AI พร้อมเรียนรู้คุณสมบัติเด่นที่ทำให้ผู้ช่วย AI นี้น่าสนใจ ทั้งหน่วยความจำถาวร การแจ้งเตือนเชิงรุก และความสามารถในการทำงานอัตโนมัติ

By