Video yükleniyor...
Video Yüklenemedi
用 Ling-3.0-flash-VL 做了个图文识别小工具。 功能很简单:图片丢进去,直接识别里面的文字、数字、公式,同时尽可能保留原来的排版和内容关系。 为了看看它处理复杂图片到底怎么样,测试素材故意选得杂了一点: • 数学论文:正文、公式、上下标、希腊字母混排 • IDE:小字号代码、Terminal 输出、各种符号 • 图表:表格、数字、文字挤在一起 • 暗光菜单:低对比度、中英文混排 • 手写笔记:字形不标准、排版随意 • 发票:字段密集,而且金额和数字不能认错 全部跑完以后,Ling-3.0-flash-VL 这部分的表现比预想中完整。 数学公式里的上下标和符号关系基本都能保住,小字号代码没有因为界面信息太密而丢掉大量字符;表格、发票这种更考验位置关系的图片,字段和数字之间的对应也没有被打乱。 暗光和手写反而挺有意思。 这两类图片肉眼看都没有标准文档那么舒服,但模型依然能从背景里把主要内容抽出来。不是只能认几个醒目的大字,边角的小字和局部信息也能顾到。 不过这次测下来,比较值得说的其实不是“OCR 准不准”。 传统 OCR 很容易把一张复杂页面最后变成一长串文本。字可能都认识,但标题属于哪里、公式跟着哪一段、数字对应表格哪一列,这些关系一丢,后面还得重新整理。 Ling-3.0-flash-VL 对这部分处理得更像是在“读页面”。 标题还是标题,正文跟着正文,公式和表格也能尽量保持原来的关系。原图里的视觉结构,没有在转成文字之后直接消失。 这会直接影响后面的用法。 论文截图可以继续转 Markdown / LaTeX,票据可以继续抽字段,软件截图可以拿去做知识库,成批的图片也能进一步整理成结构化数据。 图文识别本身并不是什么新鲜功能。 但如果模型能把一张人能读懂的复杂图片,尽量完整地变成机器也能继续处理的内容,那它能做的事情就比“识字”多得多了。 这也是这次用 Ling-3.0-flash-VL 做完这个小工具后,感觉最有实际价值的地方。 🔗GitHub: 🔗 Ling-3.0-flash-VL 在线体验 目前在 OpenRouter 上可免费体验: 模型:Ling-3.0-flash-VL... show more
22,106 görüntüleme • 4 gün önce •via X (Twitter)
38 Yorum

Really impressive visual parsing across math papers, IDE code, and handwritten notes. Maintaining structural context makes downstream RAG so much cleaner

挺不错的,包括Deepseek去年有一篇论文,其主要机制就是通过OCR技术,将文字转化为画面,以实现更高效的文字识别。

The layout preservation is the part that matters most. Extracting the words is one thing, but keeping formulas, tables, and field relationships intact makes the output much more useful downstream.

That distinction between traditional flat-string OCR and a VLM actually "reading the page" structurally—preserving Markdown formatting, LaTeX formulas, and table cell relationships—is a massive leap for document parsing. Did Ling-3.0-flash-VL handle multi-column academic paper layouts smoothly without scrambling the reading order?

Pulling reliable structured data out of tricky inputs like low-light menus and irregular handwriting without losing corner details or field correspondences changes everything for automated document ingestion. That GitHub repo is a goldmine for anyone looking to ditch brittle legacy OCR pipelines. Have you benchmarked its throughput when running batch extractions on large folders of mixed files?

Testing it on low-light images, handwritten notes, code, and invoices is a much better stress test than using clean documents alone. The real challenge is preserving structure when the input gets messy.

这个测法很到位。Ling-3.0-flash-VL这种“读版面”不是纯OCR准不准,是公式上下标+代码小字+表格暗光+手写笔记这种混合版面,结构不乱才是关键。

医疗报告解读能整理趋势和提问清单,下次产检能问得更具体。

你说的最后一点很对,OCR只是把字认出来,读版面是把“正文跟着正文、公式跟着表格、票据金额对上数字”这种关系保住,后面才能直接转Markdown/LaTeX进知识库,价值一下就大了。

对,真正拉开差距的其实是结构理解。OCR 解决“看见了什么字”,版面解析解决“这些内容之间是什么关系”。一旦表格、公式、标题层级、票据字段这些关系没丢,后面做 Markdown/LaTeX、RAG、知识库检索才是真的能直接用。

Really impressed by how well it handled the messy real-world cases. Handwritten notes and low-contrast menus are where most models fall apart, yet it still pulled the important bits without losing context. Feels less like “OCR” and more like actual document understanding.

布局保留这块确实比单纯识字更关键。你测的论文公式、IDE 小字、发票字段对应,已经把“读页面”这件事说清楚了。 再往外扩一点,其他博主这几天的测法也能对上: 有人直接把设计稿丢进去,让它吐完整 HTML/CSS/JS,8 秒多就能出可打开的页面,整体版式能保住,细节还会有偏差。也有人拿它当剪辑助理,给 15 秒宴席镜头,它会按动作拆段,并指出“桌下杯盏”这类看似边角、其实承接前后状态的画面不该剪掉。还有人测 9 秒会议视频:人物、指向图表、白板文字、屏幕折线都能分开认,但业务结论它不会乱编,更像素材标注助手,不适合直接当会议纪要。 财务向测试也挺有意思:密集表格能对总、能发现人为埋进去的金额差,但 9px 防伪小字仍然会漏。官方说的视觉闭环(看→做→核→改)在前端生成、票据入账这类任务上更有用——识完还要能结构化输出,后面才能进知识库或账本。 所以你这个小工具的价值,不只是 OCR 更准,而是把复杂图变成还能继续处理的结构。论文转 LaTeX、票据抽字段、截图建库,都可以往这条路上走。

This is exactly the kind of practical tool I’ve been hoping to see more of. Most OCR tools just dump text into a flat string, but you actually preserved the visual structure — formulas staying attached to their paragraphs, tables keeping their relationships, even low-contrast and handwritten notes coming through cleanly. That makes the output so much more usable downstream.

What an amazing innovation

The real value isn’t just OCR accuracy—it’s preserving the structure of the original image. Keeping formulas, tables, code, and field relationships intact makes the extracted content far more useful for downstream automation.

Exactly. Accurate text is useful, but preserving the structure is what makes the output actually usable.

上下标和希腊字母混排还能保住关系,这点比纯识别准不准更关键。论文截图如果公式和正文对不上,后面转 LaTeX 基本还是要人肉重排。

这个思路很有价值!不只是识别文字,还能尽量保留复杂图片里的结构和语义关系,这对论文、表格和知识库构建都很实用。期待看看它在更多真实场景中的表现!

这个测试太全面了!故意选的复杂场景正好卡在图文识别的难点上,数学论文的上标下标希腊字母混排、IDE小字号代码、表格发票的字段对应关系,Ling-3.0-flash-VL居然都能保住排版和对应关系没打乱,太强了。低对比度暗光菜单和手写笔记都能处理,这OCR能力已经超出预期了!

手写那组挺意外 我回头也拿自己笔记试试

这个比普通OCR有用

感觉好像不错啊

Ling-3.0-flash-VL 做小工具确实很快 我也打算做个提醒小工具

这个工具最有价值的地方不是单纯识字,而是公式、表格和字段关系都还能对得上,后面转 Markdown 或抽数据会省很多事。

不只是识字 能保住页面结构才实用

我自己用下来,比较明显的感受是:它不太像传统 OCR 那种“把字认出来就结束了”。 尤其是论文、代码截图、表格这类东西,真正麻烦的其实不是识字,而是把原来的结构弄丢了。之前 OCR 出来经常是一大段文本,后面还得自己重新整理。 Ling-3.0-flash-VL 在这方面确实更省事一些。公式、上下标、表格关系,还有截图里的文字层级,都能尽量保留下来。 如果后面还要把这些内容继续交给 AI 做总结、转 Markdown/LaTeX 或整理数据,这种结构化的识别结果会方便很多。 我觉得“看懂一张复杂图片”可能比单纯“把图片里的字识别出来”更有实际价值。

大模型比传统 ocr 好在不只是识别文字,还能识别格式、语义,但是难点也在有幻觉,有时候会强行识别出模糊的内容

What I really appreciated is how you focused on the harder part: not just “did it recognize the words correctly,” but “did it keep the visual hierarchy and relationships that make the content usable.” That’s where most tools quietly fail.

发票那块我特别有同感。之前用传统OCR抽发票字段,金额和表头经常错位,后处理写了一堆正则去修,维护起来很痛苦。后来换成VLM类模型直接按结构输出JSON,字段对应关系基本不用再拼了。你这个工具如果能把票据直接吐成结构化数据,落地价值确实大。

太实用了这个小工具!丢图进去直接保留原版面和内容关系,比单纯OCR强太多了。最难的发票金额数字不能认错和表格位置对应都稳住了,小字号代码也没丢字符,看来Ling-3.0-flash-VL在复杂版面理解上是真有东西,求开源一下工具!

公式代码字段关系还能保住,这比只会认图好看多了。你说它更像在读页面,我认。暗光菜单和手写发票里,哪一块最容易翻车。

有点超出预期了诶

确实耶,可以拿来当小猿搜题了哈哈哈

OCR不只是识字,能读页面才实用

好东西真多,先收藏了再说

这个功能看起来真不错

The useful part is preserving structure, because recognizing the text means little if the relationships between formulas, tables, and fields are lost.

Really solid work. The layout-aware parsing is the part that actually matters formulas, tables, and field relationships stay usable instead of turning into a dumped string of text. That’s a genuine step up from typical OCR.
