Загрузка видео...

Не удалось загрузить видео

На главную

GitHub 宝藏项目:MinerU(5.8 万 ⭐) 它把 PDF 直接变成 AI 能用的数据 以前处理 PDF: 表格乱 公式废 排版崩 OCR 一堆垃圾 能用,但很痛苦。 MinerU 不一样: 它在理解文档,不是读文字 文本、表格、公式一起解析 结构完整还原(标题、段落、表格) 公式转 LaTeX 自动去掉页眉页脚 关键就一个: 把非结构化 PDF 变成结构化数据 这一步,正好是 AI 最难的入口。 别人还在做 OCR, 它已经在做 AI 数据预处理了。 做 RAG、Agent、知识库的, 这个可以直接上手试。

35,459 просмотров • 4 месяцев назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

这个项目,真的让我重新燃起了做账号矩阵的冲动。 一个 14.5k stars 的开源项目,直接把 Google NotebookLM 变成内容生产流水线。 NotebookLM 很多人应该都用过。 上传 PDF、网页、YouTube,它就能帮你整理资料、生成播客、做学习指南。 但官方网页版有个很难受的问题: 太慢了。 传个 PDF,等解析; 点生成音频,再等; 下载,再等。 一套流程跑完,时间全浪费在等待上。 更关键的是: 它根本不适合批量搞内容。 你想一次处理几十个链接? 想自动生成一批播客? 想接到自己的工作流里? 网页版基本没法玩。 直到我发现了 notebooklm-py。 这是一个非官方 Python API,等于把 NotebookLM 的能力全拆出来了。 很多功能甚至比网页版还狠: - 一行命令生成播客 - 支持不同风格、时长、语言 - 批量导入 YouTube / PDF / URL - 幻灯片直接导出 PPTX - 思维导图导出 JSON - 数据导出 CSV - 测验题结构化导出 - 还能用自然语言改单页 PPT 最强的是: 它还能接进 Claude Code,当 Agent 技能用。 看到这里我脑子里第一反应就是: 这不就是账号矩阵生产线吗? 热点抓取 → AI研究 → 播客生成 → 图文整理 → PPT生成 → 自动分发 整个链路都能串起来。 以前做矩阵,拼的是人多。 现在越来越像拼工作流了。 很多以前需要团队才能做的事情, 现在一个人也能跑起来。

开发者Hailey

21,085 просмотров • 2 месяцев назад

做数据分析的人应该都懂那种崩溃感: Excel 一开就卡、SQL 跑半天、模型调参像瞎猜、报告一写就是一下午。 更别说很多人本职工作也不是“数据科学家”,但又不得不啃一堆 CSV、报表和图表。 这两天看到人民大学 RUC Datalab 开源的DeepAnalyze,有点眼前一亮。 它不是那种“帮你写点分析文案”的 AI,而是想做一个真正的「AI 数据分析师」: 能读 Excel/CSV/JSON/TXT,自己规划步骤、清洗数据、建模、画图、最后给你一份完整报告。 甚至还能把推理链(reasoning trace)展示出来,让你看到它是怎么一步步想出来的。 我自己最有感觉的点有几个: 以前 ChatGPT 更像“写稿子、写代码”的助手,但对数据本身不够“懂”; DeepAnalyze 直接把这一块补上了,做到“从数据到报告”的全流程; 对普通人来说,可能第一次有机会把“专业的数据分析能力”当成一个工具来用,而不是一门必须自己啃几年的技能。 当然,它现在肯定还不完美,落地也需要折腾环境、准备数据。 但这个方向我很看好: AI 帮你做繁琐的统计和建模,人类负责问好问题、选好指标、做最后决策。 数据分析不再是少数人的特权,而是变成人人可用的一种“智能能力”。 简单说: 过去是「你学会数据分析再去用工具」, 以后可能是「你先有一个 AI 数据分析师,再慢慢学会怎么问对问题」。

sitin

15,309 просмотров • 9 месяцев назад

牛逼了兄弟们,TinyFish刚刚开源了BigSet!你可以一句话直接生成任意数据集—— 只需要描述你想要搜索查询的数据,比如AI工具价格、竞品动态、招聘信息、黑客松比赛,BigSet就会调用大模型和网页检索API,直接把公开网页里的信息整理成结构化表格返回,而且能定时刷新数据集。​ ​ 上周偶然的机会,我参加一个线上黑客松,拿了很不错的奖金,所以我一直在关注全球的黑客松赛事,但是这种黑客松赛事比较分散,自己挨个去找太麻烦了,所以我让BigSet帮我构建一个实时数据集,收录全球范围内未来 90 天内正在开放报名的所有黑客松。 最后返回了具体的链接、黑客松名称、报名截止时间、奖金、线上支持......我能直接选择心仪的,直接跳转到具体的黑客松活动网址报名,节省了大量的时间!​ ​ BigSet还是多Agent架构,这就决定了它抓取任务分工明确、速度更快、结果更清楚,天然更适配处理表格类的任务。 如果你经常做竞品调研或者经常需要把分散在公开网页里的信息整理成表格,完全可以试试BigSet。而且它和Firecrawl这种专业数据抓取工具不同,你不需要丢给它URL,只需要把需求说清楚,AI就会自动去找到目标网站、抓取数据并且返回结构化的表格数据。​ ​ BigSet完全开源,AGPL-3.0许可,你可以自托管在本地运行,默认接入OpenRouter 大模型 API和TinyFish网页数据获取的API。​ ​ 如果觉得BigSet有用,可以去GitHub给它点个 star~: TinyFish网页数据获取API Key:

逸尘

12,042 просмотров • 2 месяцев назад