pdf Archive

เพิ่งเห็นว่าใน Google Chrome สามารถจัดการ pdf ได้

ใน Google Chrome ตัวล่าสุด หลังจาก update ไปพบว่าสามารถจัดการ PDF ได้เลย ซึ่งมีความสามารถพื้นฐาน คือ และยังสามารถเลือก download ด้วย original หรือเพิ่มการเปลี่ยนแปลงได้ลองใช้งานกันดูครับ น่าจะอำนวยความสะดวกมากขึ้น

Read More…

Library สำหรับการอ่านข้อมูลในรูปแบบต่าง ๆ

ในการสร้าง RAG app (Retrieval Augmented Generation) นั้นขั้นตอนการ retrieve ข้อมูลนั้นสำคัญมาก ๆ สำหรับความถูกต้องแต่อีกเรื่องที่สำคัญมาก ๆ คือการอ่านข้อมูลจาก data source ชนิดต่าง ๆ มากมายเพื่อนำมาใช้งาน หรือ ในรูปแบบที่เอื้อต่อ AI (AI friendly)เช่น เราจะทำอย่างไรบ้าง

Read More…

ทำความรู้จักกับ Docling สำหรับการแปลงข้อมูลจากไฟล์ต่าง ๆ ให้ง่ายต่อการนำไปใช้งาน

ทำความรู้จักกับ Docling สำหรับการแปลงข้อมูลจากไฟล์ต่าง ๆ ให้ง่ายต่อการนำไปใช้งานเช่นการใช้งานในโลกของ AI หรือ LLM นั่นเอง (AI Friendly) จาก IBMโดยพื้นฐานจะทำงานเหมือนกับ markitdown จาก Microsoftสนับสนุน format file ต่าง ๆแต่สิ่งที่เพิ่มเติมเข้ามา คือ Advance PDF processingนั่นคือ สามารถอ่านและทำความเข้าใจข้อมูลในไฟล์ PDF ได้ดีขึ้น

Read More…

ทดลองใช้ Mistral OCR สำหรับอ่านข้อมูลจาก PDF

เห็น Mistral OCR เปิดให้ใช้งานพอดีมี use case ต้องใช้งานเกี่ยวกับ OCR(Optical Character Recognition)ซึ่งเป็นไฟล์ PDF ที่ scan เป็นรูป มาจากเอกสารที่เป็นกระดาษดังนั้นจึงต้องทำการอ่านข้อมูลจากไฟล์เหล่านี้มาใช้งานทั้งการ chunking และ embeddingเพื่อทำการจัดเก็บใน Vector database เพื่อใช้งานต่อไปดังนั้นมาลองใช้งานกันดู

Read More…

Microsoft ปล่อย markitdown library สำหรับแปลงข้อมูลจากไฟล์ต่าง ๆ มาอยู่ในรูปแบบของ Markdown

ทาง Microsoft ได้ปล่อย MarkitDown library สำหรับภาษา Pythonสำหรับการแปลงข้อมูลจากไฟล์ต่าง ๆ มาอยู่ในรูปแบบของ Markdownเพื่อให้สามารถนำไปใช้งานต่อได้ง่าย ๆ เช่นการ indexing ข้อมูล และ การวิเคราะห์ข้อมูล เป็นต้น

Read More…