Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

牛,Mistral刚刚发布了号称地表最强OCR,给文档理解设立了新标准! Mistral OCR具备强大认知能力,能准确理解文档中包括文本、图像、表格、公式等在内的每个元素 特点: 1、原生多语言和多模态,支持数千种文字、字体以及语言 2、能准确理解复杂的文档元素,包括图像、数学公式、表格以及 LaTeX 格式等,尤其擅长处理包含图表、图形、公式和插图的科学论文等富文档 3、在多个文档分析方面的基准测试中优于其他OCR模型,尤其在扫描文档、表格和数学公式识别上表现出色 4、处理速度很快,单节点每分钟可处理2000页 5、支持使用文档作为提示,以结构化格式比如 JSON输出 6、可选择性自托管 #OCR #MistralOCR #Mistral

111,943 Aufrufe • vor 1 Jahr •via X (Twitter)

7 Kommentare

Profilbild von AIGCLINK
AIGCLINKvor 1 Jahr

功能可以在 要体验API可以访问 博客:

Profilbild von AssemblyAI
AssemblyAIvor 1 Jahr

Announcing: Our most advanced speech-to-text model goes beyond accuracy to capture the real-world complexity of human conversation and deliver reliable, source-of-truth audio data. Explore Universal-2 updates 👇

Profilbild von 币安高返佣注册申请 (Parody)
币安高返佣注册申请 (Parody)vor 1 Jahr

牛逼

Profilbild von amadeuzou
amadeuzouvor 1 Jahr

@tenglvjun

Profilbild von Winnerineast
Winnerineastvor 1 Jahr

自托管?

Profilbild von qiu lan
qiu lanvor 1 Jahr

没开源吗?

Profilbild von mosi
mosivor 1 Jahr

I recently tested some strategies and found that the results weren't as impressive as expected. Sometimes, what seems effective in theory doesn't pan out in practice. Always important to validate claims with real-world testing! #Testing #RealResults

Ähnliche Videos

用 Ling-3.0-flash-VL 做了个图文识别小工具。 功能很简单:图片丢进去,直接识别里面的文字、数字、公式,同时尽可能保留原来的排版和内容关系。 为了看看它处理复杂图片到底怎么样,测试素材故意选得杂了一点: • 数学论文:正文、公式、上下标、希腊字母混排 • IDE:小字号代码、Terminal 输出、各种符号 • 图表:表格、数字、文字挤在一起 • 暗光菜单:低对比度、中英文混排 • 手写笔记:字形不标准、排版随意 • 发票:字段密集,而且金额和数字不能认错 全部跑完以后,Ling-3.0-flash-VL 这部分的表现比预想中完整。 数学公式里的上下标和符号关系基本都能保住,小字号代码没有因为界面信息太密而丢掉大量字符;表格、发票这种更考验位置关系的图片,字段和数字之间的对应也没有被打乱。 暗光和手写反而挺有意思。 这两类图片肉眼看都没有标准文档那么舒服,但模型依然能从背景里把主要内容抽出来。不是只能认几个醒目的大字,边角的小字和局部信息也能顾到。 不过这次测下来,比较值得说的其实不是“OCR 准不准”。 传统 OCR 很容易把一张复杂页面最后变成一长串文本。字可能都认识,但标题属于哪里、公式跟着哪一段、数字对应表格哪一列,这些关系一丢,后面还得重新整理。 Ling-3.0-flash-VL 对这部分处理得更像是在“读页面”。 标题还是标题,正文跟着正文,公式和表格也能尽量保持原来的关系。原图里的视觉结构,没有在转成文字之后直接消失。 这会直接影响后面的用法。 论文截图可以继续转 Markdown / LaTeX,票据可以继续抽字段,软件截图可以拿去做知识库,成批的图片也能进一步整理成结构化数据。 图文识别本身并不是什么新鲜功能。 但如果模型能把一张人能读懂的复杂图片,尽量完整地变成机器也能继续处理的内容,那它能做的事情就比“识字”多得多了。 这也是这次用 Ling-3.0-flash-VL 做完这个小工具后,感觉最有实际价值的地方。 🔗GitHub: 🔗 Ling-3.0-flash-VL 在线体验 目前在 OpenRouter 上可免费体验: 模型:Ling-3.0-flash-VL 官方:Ant Ling

Hello AI with Jia

26,341 Aufrufe • vor 22 Tagen