Hello AI with Jia's banner
Hello AI with Jia's profile picture

Hello AI with Jia

@XChatScout • 7,921 subscribers

AI 工具实测|大模型 & Agent|开源项目研究|数据可视化|项目投研|每天分享一点 AI 新发现

Shorts

公共厕所的摄像头 真的太离谱了 大家出门在外上厕所一定要多看一下

公共厕所的摄像头 真的太离谱了 大家出门在外上厕所一定要多看一下

8,219,758 次观看

昨天在偶然刷到这个网站 - 《动画巡礼》 作者将各种日本动画的场景标注在 Google 地图上,数据特别丰富,全是力气活,我在想这么多都是人工标注的吗?真的好棒啊,还开放了API,交互也做的很不错,喜欢日本动漫的朋友们真的不能错过哈,去日本可以直接按照标注去玩了,也可以在特定的地点拍对比图。 开源库在这里: 感兴趣的同学还能 PR 提交自己的数据。

昨天在偶然刷到这个网站 - 《动画巡礼》 作者将各种日本动画的场景标注在 Google 地图上,数据特别丰富,全是力气活,我在想这么多都是人工标注的吗?真的好棒啊,还开放了API,交互也做的很不错,喜欢日本动漫的朋友们真的不能错过哈,去日本可以直接按照标注去玩了,也可以在特定的地点拍对比图。 开源库在这里: 感兴趣的同学还能 PR 提交自己的数据。

2,265,268 次观看

我觉得所有交易所的人脸识别功能需要提升了 据我所知,目前bitget,bybit还有芝麻的人脸功能早就ai功能破解 他们的新人活动时常被黑的主要原因就是很多ai玩家通过ai来过kyc来伪装新人用户 只需要一张照片就可以

我觉得所有交易所的人脸识别功能需要提升了 据我所知,目前bitget,bybit还有芝麻的人脸功能早就ai功能破解 他们的新人活动时常被黑的主要原因就是很多ai玩家通过ai来过kyc来伪装新人用户 只需要一张照片就可以

57,809 次观看

行走的炸弹??我都没有见多那么大的

行走的炸弹??我都没有见多那么大的

22,065 次观看

Videos

XChatScout's profile picture

用 Ling-3.0-flash-VL 做了个图文识别小工具。 功能很简单:图片丢进去,直接识别里面的文字、数字、公式,同时尽可能保留原来的排版和内容关系。 为了看看它处理复杂图片到底怎么样,测试素材故意选得杂了一点: • 数学论文:正文、公式、上下标、希腊字母混排 • IDE:小字号代码、Terminal 输出、各种符号 • 图表:表格、数字、文字挤在一起 • 暗光菜单:低对比度、中英文混排 • 手写笔记:字形不标准、排版随意 • 发票:字段密集,而且金额和数字不能认错 全部跑完以后,Ling-3.0-flash-VL 这部分的表现比预想中完整。 数学公式里的上下标和符号关系基本都能保住,小字号代码没有因为界面信息太密而丢掉大量字符;表格、发票这种更考验位置关系的图片,字段和数字之间的对应也没有被打乱。 暗光和手写反而挺有意思。 这两类图片肉眼看都没有标准文档那么舒服,但模型依然能从背景里把主要内容抽出来。不是只能认几个醒目的大字,边角的小字和局部信息也能顾到。 不过这次测下来,比较值得说的其实不是“OCR 准不准”。 传统 OCR 很容易把一张复杂页面最后变成一长串文本。字可能都认识,但标题属于哪里、公式跟着哪一段、数字对应表格哪一列,这些关系一丢,后面还得重新整理。 Ling-3.0-flash-VL 对这部分处理得更像是在“读页面”。 标题还是标题,正文跟着正文,公式和表格也能尽量保持原来的关系。原图里的视觉结构,没有在转成文字之后直接消失。 这会直接影响后面的用法。 论文截图可以继续转 Markdown / LaTeX,票据可以继续抽字段,软件截图可以拿去做知识库,成批的图片也能进一步整理成结构化数据。 图文识别本身并不是什么新鲜功能。 但如果模型能把一张人能读懂的复杂图片,尽量完整地变成机器也能继续处理的内容,那它能做的事情就比“识字”多得多了。 这也是这次用 Ling-3.0-flash-VL 做完这个小工具后,感觉最有实际价值的地方。 🔗GitHub: 🔗 Ling-3.0-flash-VL 在线体验 目前在 OpenRouter 上可免费体验: 模型:Ling-3.0-flash-VL 官方:Ant Ling

Hello AI with Jia

24,454 次观看 • 8 天前

XChatScout's profile picture

最近在看 Broadcom,所以最新财报出来后,我直接拿来测了下 Ling-3.0-flash-Fin。 我比较想知道的是:AI 业务涨得这么快,Broadcom 现在的增长到底有多依赖 AI? 这次没有让模型简单总结财报,而是让它顺着半导体、AI 收入、软件业务、利润和现金流一路拆下去,同时核对数据来源和口径。 最后给出的判断比较清楚: Broadcom 这季度增长很强,AI 已经成了最明显的驱动力,现金流表现也不错。 但隐患也很明显——如果后面的增长越来越集中在 AI 加速器和网络需求上,那就要继续看这种高强度需求到底能维持多久。 这也是 Ling-3.0-flash-Fin 比较有意思的地方。 它不是只回答一个金融问题,而是会把检索、分析、计算和结果整理串起来,最后给出可以复核的结论和风险提示。 它基于 Ling-3.0-flash 继续做金融增强,依旧是 124B 总参数、5.1B 激活参数。 这次比较让我意外的是,它对财务数据之间关系的处理,明显更像在真正做研究:不会看到一个高增长数字就停下来,而是会继续追收入结构、利润、现金流和潜在风险。 至少从这次 Broadcom 财报测试来看,它的金融增强,不只是“更懂几个金融术语”。 Ling-3.0-flash-Fin 试试,大家现在可以直接在 OpenRouter 上体验: 开源地址: 以上仅为模型测试,不构成任何投资建议。

Hello AI with Jia

33,402 次观看 • 12 天前

小作文之 我在东北电子厂 遭遇女同性恋性骚扰…这也太恶心啦
1:00

Sensitive content

This media may contain sensitive content.

他们说酒吧里面这种女生最容易搭讪了??
0:33

Sensitive content

This media may contain sensitive content.

没有更多内容可加载