Загрузка видео...
Не удалось загрузить видео
GitHub 宝藏项目:MinerU(5.8 万 ⭐) 它把 PDF 直接变成 AI 能用的数据 以前处理 PDF: 表格乱 公式废 排版崩 OCR 一堆垃圾 能用,但很痛苦。 MinerU 不一样: 它在理解文档,不是读文字 文本、表格、公式一起解析 结构完整还原(标题、段落、表格) 公式转 LaTeX 自动去掉页眉页脚 关键就一个: 把非结构化 PDF 变成结构化数据 这一步,正好是 AI 最难的入口。 别人还在做 OCR, 它已经在做 AI 数据预处理了。 做 RAG、Agent、知识库的, 这个可以直接上手试。
35,459 просмотров • 4 месяцев назад •via X (Twitter)
Комментарии: 0
Нет доступных комментариев
Здесь появятся комментарии из оригинального поста
