Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

GitHub 宝藏项目:MinerU(5.8 万 ⭐) 它把 PDF 直接变成 AI 能用的数据 以前处理 PDF: 表格乱 公式废 排版崩 OCR 一堆垃圾 能用,但很痛苦。 MinerU 不一样: 它在理解文档,不是读文字 文本、表格、公式一起解析 结构完整还原(标题、段落、表格) 公式转 LaTeX 自动去掉页眉页脚 关键就一个: 把非结构化 PDF 变成结构化数据 这一步,正好是 AI 最难的入口。 别人还在做 OCR, 它已经在做 AI 数据预处理了。 做 RAG、Agent、知识库的, 这个可以直接上手试。

35,459 Aufrufe • vor 6 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

用 Ling-3.0-flash-VL 做了个图文识别小工具。 功能很简单:图片丢进去,直接识别里面的文字、数字、公式,同时尽可能保留原来的排版和内容关系。 为了看看它处理复杂图片到底怎么样,测试素材故意选得杂了一点: • 数学论文:正文、公式、上下标、希腊字母混排 • IDE:小字号代码、Terminal 输出、各种符号 • 图表:表格、数字、文字挤在一起 • 暗光菜单:低对比度、中英文混排 • 手写笔记:字形不标准、排版随意 • 发票:字段密集,而且金额和数字不能认错 全部跑完以后,Ling-3.0-flash-VL 这部分的表现比预想中完整。 数学公式里的上下标和符号关系基本都能保住,小字号代码没有因为界面信息太密而丢掉大量字符;表格、发票这种更考验位置关系的图片,字段和数字之间的对应也没有被打乱。 暗光和手写反而挺有意思。 这两类图片肉眼看都没有标准文档那么舒服,但模型依然能从背景里把主要内容抽出来。不是只能认几个醒目的大字,边角的小字和局部信息也能顾到。 不过这次测下来,比较值得说的其实不是“OCR 准不准”。 传统 OCR 很容易把一张复杂页面最后变成一长串文本。字可能都认识,但标题属于哪里、公式跟着哪一段、数字对应表格哪一列,这些关系一丢,后面还得重新整理。 Ling-3.0-flash-VL 对这部分处理得更像是在“读页面”。 标题还是标题,正文跟着正文,公式和表格也能尽量保持原来的关系。原图里的视觉结构,没有在转成文字之后直接消失。 这会直接影响后面的用法。 论文截图可以继续转 Markdown / LaTeX,票据可以继续抽字段,软件截图可以拿去做知识库,成批的图片也能进一步整理成结构化数据。 图文识别本身并不是什么新鲜功能。 但如果模型能把一张人能读懂的复杂图片,尽量完整地变成机器也能继续处理的内容,那它能做的事情就比“识字”多得多了。 这也是这次用 Ling-3.0-flash-VL 做完这个小工具后,感觉最有实际价值的地方。 🔗GitHub: 🔗 Ling-3.0-flash-VL 在线体验 目前在 OpenRouter 上可免费体验: 模型:Ling-3.0-flash-VL 官方:Ant Ling

Hello AI with Jia

26,341 Aufrufe • vor 22 Tagen

这个项目,真的让我重新燃起了做账号矩阵的冲动。 一个 14.5k stars 的开源项目,直接把 Google NotebookLM 变成内容生产流水线。 NotebookLM 很多人应该都用过。 上传 PDF、网页、YouTube,它就能帮你整理资料、生成播客、做学习指南。 但官方网页版有个很难受的问题: 太慢了。 传个 PDF,等解析; 点生成音频,再等; 下载,再等。 一套流程跑完,时间全浪费在等待上。 更关键的是: 它根本不适合批量搞内容。 你想一次处理几十个链接? 想自动生成一批播客? 想接到自己的工作流里? 网页版基本没法玩。 直到我发现了 notebooklm-py。 这是一个非官方 Python API,等于把 NotebookLM 的能力全拆出来了。 很多功能甚至比网页版还狠: - 一行命令生成播客 - 支持不同风格、时长、语言 - 批量导入 YouTube / PDF / URL - 幻灯片直接导出 PPTX - 思维导图导出 JSON - 数据导出 CSV - 测验题结构化导出 - 还能用自然语言改单页 PPT 最强的是: 它还能接进 Claude Code,当 Agent 技能用。 看到这里我脑子里第一反应就是: 这不就是账号矩阵生产线吗? 热点抓取 → AI研究 → 播客生成 → 图文整理 → PPT生成 → 自动分发 整个链路都能串起来。 以前做矩阵,拼的是人多。 现在越来越像拼工作流了。 很多以前需要团队才能做的事情, 现在一个人也能跑起来。

开发者Hailey

21,316 Aufrufe • vor 4 Monaten

做数据分析的人应该都懂那种崩溃感: Excel 一开就卡、SQL 跑半天、模型调参像瞎猜、报告一写就是一下午。 更别说很多人本职工作也不是“数据科学家”,但又不得不啃一堆 CSV、报表和图表。 这两天看到人民大学 RUC Datalab 开源的DeepAnalyze,有点眼前一亮。 它不是那种“帮你写点分析文案”的 AI,而是想做一个真正的「AI 数据分析师」: 能读 Excel/CSV/JSON/TXT,自己规划步骤、清洗数据、建模、画图、最后给你一份完整报告。 甚至还能把推理链(reasoning trace)展示出来,让你看到它是怎么一步步想出来的。 我自己最有感觉的点有几个: 以前 ChatGPT 更像“写稿子、写代码”的助手,但对数据本身不够“懂”; DeepAnalyze 直接把这一块补上了,做到“从数据到报告”的全流程; 对普通人来说,可能第一次有机会把“专业的数据分析能力”当成一个工具来用,而不是一门必须自己啃几年的技能。 当然,它现在肯定还不完美,落地也需要折腾环境、准备数据。 但这个方向我很看好: AI 帮你做繁琐的统计和建模,人类负责问好问题、选好指标、做最后决策。 数据分析不再是少数人的特权,而是变成人人可用的一种“智能能力”。 简单说: 过去是「你学会数据分析再去用工具」, 以后可能是「你先有一个 AI 数据分析师,再慢慢学会怎么问对问题」。

sitin

15,328 Aufrufe • vor 11 Monaten