Loading video...
Video Failed to Load
发现一个能直接省掉每天2小时重复劳动的东西。 文档提取、信息结构化这块,之前靠正则、靠手写NER、靠天价API、靠人工熬夜抄数据,现在基本可以宣布进入倒计时了。 Google 刚开源了 LangExtract。 一句话讲清楚它能干嘛:把任何乱七八糟的长文本(合同、报告、论文、会议纪要,哪怕上百页),直接变成干净、结构化、还能回溯原文的数据。而且不是那种“大概提取一下就行”的半成品。 它会把每一条结果精确映射回原文的具体位置,生成一个可交互的HTML页面,点进去就能核对。做合规、做审计、做知识库的人,看到这个功能基本会直接尖叫。 支持 Gemini、Ollama、本地模型,想省钱就本地跑,想效果好就上云。 安装极其简单:pip install langextract,几分钟就能跑起来。以前那些脆弱的正则表达式、自己维护的NER管道、一年几十万的提取服务,现在看着都有点滑稽了。 免费、开源、真能干活。
22,868 views • 19 days ago •via X (Twitter)
0 Comments
No comments available
Comments from the original post will appear here
