
Hello AI with Jia
@XChatScout • 7,921 subscribers
AI 工具实测|大模型 & Agent|开源项目研究|数据可视化|项目投研|每天分享一点 AI 新发现
Shorts
Videos
1:13
Sensitive content
This media may contain sensitive content.

用 Ling-3.0-flash-VL 做了个图文识别小工具。 功能很简单:图片丢进去,直接识别里面的文字、数字、公式,同时尽可能保留原来的排版和内容关系。 为了看看它处理复杂图片到底怎么样,测试素材故意选得杂了一点: • 数学论文:正文、公式、上下标、希腊字母混排 • IDE:小字号代码、Terminal 输出、各种符号 • 图表:表格、数字、文字挤在一起 • 暗光菜单:低对比度、中英文混排 • 手写笔记:字形不标准、排版随意 • 发票:字段密集,而且金额和数字不能认错 全部跑完以后,Ling-3.0-flash-VL 这部分的表现比预想中完整。 数学公式里的上下标和符号关系基本都能保住,小字号代码没有因为界面信息太密而丢掉大量字符;表格、发票这种更考验位置关系的图片,字段和数字之间的对应也没有被打乱。 暗光和手写反而挺有意思。 这两类图片肉眼看都没有标准文档那么舒服,但模型依然能从背景里把主要内容抽出来。不是只能认几个醒目的大字,边角的小字和局部信息也能顾到。 不过这次测下来,比较值得说的其实不是“OCR 准不准”。 传统 OCR 很容易把一张复杂页面最后变成一长串文本。字可能都认识,但标题属于哪里、公式跟着哪一段、数字对应表格哪一列,这些关系一丢,后面还得重新整理。 Ling-3.0-flash-VL 对这部分处理得更像是在“读页面”。 标题还是标题,正文跟着正文,公式和表格也能尽量保持原来的关系。原图里的视觉结构,没有在转成文字之后直接消失。 这会直接影响后面的用法。 论文截图可以继续转 Markdown / LaTeX,票据可以继续抽字段,软件截图可以拿去做知识库,成批的图片也能进一步整理成结构化数据。 图文识别本身并不是什么新鲜功能。 但如果模型能把一张人能读懂的复杂图片,尽量完整地变成机器也能继续处理的内容,那它能做的事情就比“识字”多得多了。 这也是这次用 Ling-3.0-flash-VL 做完这个小工具后,感觉最有实际价值的地方。 🔗GitHub: 🔗 Ling-3.0-flash-VL 在线体验 目前在 OpenRouter 上可免费体验: 模型:Ling-3.0-flash-VL 官方:Ant Ling
Hello AI with Jia24,454 次观看 • 8 天前

最近在看 Broadcom,所以最新财报出来后,我直接拿来测了下 Ling-3.0-flash-Fin。 我比较想知道的是:AI 业务涨得这么快,Broadcom 现在的增长到底有多依赖 AI? 这次没有让模型简单总结财报,而是让它顺着半导体、AI 收入、软件业务、利润和现金流一路拆下去,同时核对数据来源和口径。 最后给出的判断比较清楚: Broadcom 这季度增长很强,AI 已经成了最明显的驱动力,现金流表现也不错。 但隐患也很明显——如果后面的增长越来越集中在 AI 加速器和网络需求上,那就要继续看这种高强度需求到底能维持多久。 这也是 Ling-3.0-flash-Fin 比较有意思的地方。 它不是只回答一个金融问题,而是会把检索、分析、计算和结果整理串起来,最后给出可以复核的结论和风险提示。 它基于 Ling-3.0-flash 继续做金融增强,依旧是 124B 总参数、5.1B 激活参数。 这次比较让我意外的是,它对财务数据之间关系的处理,明显更像在真正做研究:不会看到一个高增长数字就停下来,而是会继续追收入结构、利润、现金流和潜在风险。 至少从这次 Broadcom 财报测试来看,它的金融增强,不只是“更懂几个金融术语”。 Ling-3.0-flash-Fin 试试,大家现在可以直接在 OpenRouter 上体验: 开源地址: 以上仅为模型测试,不构成任何投资建议。
Hello AI with Jia33,402 次观看 • 12 天前
1:00
Sensitive content
This media may contain sensitive content.
0:33
Sensitive content
This media may contain sensitive content.
没有更多内容可加载
