Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

用 Ling-3.0-flash-VL 做了个图文识别小工具。 功能很简单:图片丢进去,直接识别里面的文字、数字、公式,同时尽可能保留原来的排版和内容关系。 为了看看它处理复杂图片到底怎么样,测试素材故意选得杂了一点: • 数学论文:正文、公式、上下标、希腊字母混排 • IDE:小字号代码、Terminal 输出、各种符号 • 图表:表格、数字、文字挤在一起 • 暗光菜单:低对比度、中英文混排 • 手写笔记:字形不标准、排版随意 • 发票:字段密集,而且金额和数字不能认错 全部跑完以后,Ling-3.0-flash-VL 这部分的表现比预想中完整。 数学公式里的上下标和符号关系基本都能保住,小字号代码没有因为界面信息太密而丢掉大量字符;表格、发票这种更考验位置关系的图片,字段和数字之间的对应也没有被打乱。 暗光和手写反而挺有意思。 这两类图片肉眼看都没有标准文档那么舒服,但模型依然能从背景里把主要内容抽出来。不是只能认几个醒目的大字,边角的小字和局部信息也能顾到。 不过这次测下来,比较值得说的其实不是“OCR 准不准”。 传统 OCR 很容易把一张复杂页面最后变成一长串文本。字可能都认识,但标题属于哪里、公式跟着哪一段、数字对应表格哪一列,这些关系一丢,后面还得重新整理。 Ling-3.0-flash-VL 对这部分处理得更像是在“读页面”。 标题还是标题,正文跟着正文,公式和表格也能尽量保持原来的关系。原图里的视觉结构,没有在转成文字之后直接消失。 这会直接影响后面的用法。 论文截图可以继续转 Markdown / LaTeX,票据可以继续抽字段,软件截图可以拿去做知识库,成批的图片也能进一步整理成结构化数据。 图文识别本身并不是什么新鲜功能。 但如果模型能把一张人能读懂的复杂图片,尽量完整地变成机器也能继续处理的内容,那它能做的事情就比“识字”多得多了。 这也是这次用 Ling-3.0-flash-VL 做完这个小工具后,感觉最有实际价值的地方。 🔗GitHub: 🔗 Ling-3.0-flash-VL 在线体验 目前在 OpenRouter 上可免费体验: 模型:Ling-3.0-flash-VL...

22,106 görüntüleme • 4 gün önce •via X (Twitter)

38 Yorum

Segun Bxx profil fotoğrafı
Segun Bxx4 gün önce

Really impressive visual parsing across math papers, IDE code, and handwritten notes. Maintaining structural context makes downstream RAG so much cleaner

古登堡 profil fotoğrafı
古登堡4 gün önce

挺不错的,包括Deepseek去年有一篇论文,其主要机制就是通过OCR技术,将文字转化为画面,以实现更高效的文字识别。

sulaiman Waleed profil fotoğrafı
sulaiman Waleed4 gün önce

The layout preservation is the part that matters most. Extracting the words is one thing, but keeping formulas, tables, and field relationships intact makes the output much more useful downstream.

Almusty profil fotoğrafı
Almusty4 gün önce

That distinction between traditional flat-string OCR and a VLM actually "reading the page" structurally—preserving Markdown formatting, LaTeX formulas, and table cell relationships—is a massive leap for document parsing. Did Ling-3.0-flash-VL handle multi-column academic paper layouts smoothly without scrambling the reading order?

Almusty profil fotoğrafı
Almusty4 gün önce

Pulling reliable structured data out of tricky inputs like low-light menus and irregular handwriting without losing corner details or field correspondences changes everything for automated document ingestion. That GitHub repo is a goldmine for anyone looking to ditch brittle legacy OCR pipelines. Have you benchmarked its throughput when running batch extractions on large folders of mixed files?

sulaiman Waleed profil fotoğrafı
sulaiman Waleed4 gün önce

Testing it on low-light images, handwritten notes, code, and invoices is a much better stress test than using clean documents alone. The real challenge is preserving structure when the input gets messy.

Em Kei profil fotoğrafı
Em Kei4 gün önce

这个测法很到位。Ling-3.0-flash-VL这种“读版面”不是纯OCR准不准,是公式上下标+代码小字+表格暗光+手写笔记这种混合版面,结构不乱才是关键。

Ayooo 👑🇱🇷 profil fotoğrafı
Ayooo 👑🇱🇷4 gün önce

医疗报告解读能整理趋势和提问清单,下次产检能问得更具体。

Em Kei profil fotoğrafı
Em Kei4 gün önce

你说的最后一点很对,OCR只是把字认出来,读版面是把“正文跟着正文、公式跟着表格、票据金额对上数字”这种关系保住,后面才能直接转Markdown/LaTeX进知识库,价值一下就大了。

Hello AI with Jia profil fotoğrafı
Hello AI with Jia4 gün önce

对,真正拉开差距的其实是结构理解。OCR 解决“看见了什么字”,版面解析解决“这些内容之间是什么关系”。一旦表格、公式、标题层级、票据字段这些关系没丢,后面做 Markdown/LaTeX、RAG、知识库检索才是真的能直接用。

Stankarl profil fotoğrafı
Stankarl4 gün önce

Really impressed by how well it handled the messy real-world cases. Handwritten notes and low-contrast menus are where most models fall apart, yet it still pulled the important bits without losing context. Feels less like “OCR” and more like actual document understanding.

Rubio is not Rubio profil fotoğrafı
Rubio is not Rubio4 gün önce

布局保留这块确实比单纯识字更关键。你测的论文公式、IDE 小字、发票字段对应,已经把“读页面”这件事说清楚了。 再往外扩一点,其他博主这几天的测法也能对上: 有人直接把设计稿丢进去,让它吐完整 HTML/CSS/JS,8 秒多就能出可打开的页面,整体版式能保住,细节还会有偏差。也有人拿它当剪辑助理,给 15 秒宴席镜头,它会按动作拆段,并指出“桌下杯盏”这类看似边角、其实承接前后状态的画面不该剪掉。还有人测 9 秒会议视频:人物、指向图表、白板文字、屏幕折线都能分开认,但业务结论它不会乱编,更像素材标注助手,不适合直接当会议纪要。 财务向测试也挺有意思:密集表格能对总、能发现人为埋进去的金额差,但 9px 防伪小字仍然会漏。官方说的视觉闭环(看→做→核→改)在前端生成、票据入账这类任务上更有用——识完还要能结构化输出,后面才能进知识库或账本。 所以你这个小工具的价值,不只是 OCR 更准,而是把复杂图变成还能继续处理的结构。论文转 LaTeX、票据抽字段、截图建库,都可以往这条路上走。

daemon profil fotoğrafı
daemon4 gün önce

This is exactly the kind of practical tool I’ve been hoping to see more of. Most OCR tools just dump text into a flat string, but you actually preserved the visual structure — formulas staying attached to their paragraphs, tables keeping their relationships, even low-contrast and handwritten notes coming through cleanly. That makes the output so much more usable downstream.

𝔻𝔼-𝕋𝔸𝕃𝔼ℕ𝕋𝔼𝔻 𝔼𝕄ℙ𝕀ℝ𝔼 | 𝕎𝔼𝔹𝟛 profil fotoğrafı
𝔻𝔼-𝕋𝔸𝕃𝔼ℕ𝕋𝔼𝔻 𝔼𝕄ℙ𝕀ℝ𝔼 | 𝕎𝔼𝔹𝟛4 gün önce

What an amazing innovation

Rakib Hossen profil fotoğrafı
Rakib Hossen4 gün önce

The real value isn’t just OCR accuracy—it’s preserving the structure of the original image. Keeping formulas, tables, code, and field relationships intact makes the extracted content far more useful for downstream automation.

Hello AI with Jia profil fotoğrafı
Hello AI with Jia4 gün önce

Exactly. Accurate text is useful, but preserving the structure is what makes the output actually usable.

Max.H profil fotoğrafı
Max.H4 gün önce

上下标和希腊字母混排还能保住关系,这点比纯识别准不准更关键。论文截图如果公式和正文对不上,后面转 LaTeX 基本还是要人肉重排。

Ethan Walker profil fotoğrafı
Ethan Walker4 gün önce

这个思路很有价值!不只是识别文字,还能尽量保留复杂图片里的结构和语义关系,这对论文、表格和知识库构建都很实用。期待看看它在更多真实场景中的表现!

meerah profil fotoğrafı
meerah4 gün önce

这个测试太全面了!故意选的复杂场景正好卡在图文识别的难点上,数学论文的上标下标希腊字母混排、IDE小字号代码、表格发票的字段对应关系,Ling-3.0-flash-VL居然都能保住排版和对应关系没打乱,太强了。低对比度暗光菜单和手写笔记都能处理,这OCR能力已经超出预期了!

Robin Jack profil fotoğrafı
Robin Jack4 gün önce

手写那组挺意外 我回头也拿自己笔记试试

易佳欣🦊 | Gate打金狗0Gas费 profil fotoğrafı
易佳欣🦊 | Gate打金狗0Gas费4 gün önce

这个比普通OCR有用

0x张万森 profil fotoğrafı
0x张万森4 gün önce

感觉好像不错啊

Banana profil fotoğrafı
Banana4 gün önce

Ling-3.0-flash-VL 做小工具确实很快 我也打算做个提醒小工具

船长 profil fotoğrafı
船长3 gün önce

这个工具最有价值的地方不是单纯识字,而是公式、表格和字段关系都还能对得上,后面转 Markdown 或抽数据会省很多事。

晨曦Nice profil fotoğrafı
晨曦Nice4 gün önce

不只是识字 能保住页面结构才实用

Steven Cheng profil fotoğrafı
Steven Cheng3 gün önce

我自己用下来,比较明显的感受是:它不太像传统 OCR 那种“把字认出来就结束了”。 尤其是论文、代码截图、表格这类东西,真正麻烦的其实不是识字,而是把原来的结构弄丢了。之前 OCR 出来经常是一大段文本,后面还得自己重新整理。 Ling-3.0-flash-VL 在这方面确实更省事一些。公式、上下标、表格关系,还有截图里的文字层级,都能尽量保留下来。 如果后面还要把这些内容继续交给 AI 做总结、转 Markdown/LaTeX 或整理数据,这种结构化的识别结果会方便很多。 我觉得“看懂一张复杂图片”可能比单纯“把图片里的字识别出来”更有实际价值。

Daniel Chen profil fotoğrafı
Daniel Chen4 gün önce

大模型比传统 ocr 好在不只是识别文字,还能识别格式、语义,但是难点也在有幻觉,有时候会强行识别出模糊的内容

Renderhaus profil fotoğrafı
Renderhaus4 gün önce

What I really appreciated is how you focused on the harder part: not just “did it recognize the words correctly,” but “did it keep the visual hierarchy and relationships that make the content usable.” That’s where most tools quietly fail.

HDUX profil fotoğrafı
HDUX4 gün önce

发票那块我特别有同感。之前用传统OCR抽发票字段,金额和表头经常错位,后处理写了一堆正则去修,维护起来很痛苦。后来换成VLM类模型直接按结构输出JSON,字段对应关系基本不用再拼了。你这个工具如果能把票据直接吐成结构化数据,落地价值确实大。

meerah profil fotoğrafı
meerah4 gün önce

太实用了这个小工具!丢图进去直接保留原版面和内容关系,比单纯OCR强太多了。最难的发票金额数字不能认错和表格位置对应都稳住了,小字号代码也没丢字符,看来Ling-3.0-flash-VL在复杂版面理解上是真有东西,求开源一下工具!

邪恶大薯条 profil fotoğrafı
邪恶大薯条3 gün önce

公式代码字段关系还能保住,这比只会认图好看多了。你说它更像在读页面,我认。暗光菜单和手写发票里,哪一块最容易翻车。

西西🎒 profil fotoğrafı
西西🎒4 gün önce

有点超出预期了诶

Hello AI with Jia profil fotoğrafı
Hello AI with Jia4 gün önce

确实耶,可以拿来当小猿搜题了哈哈哈

星烁 | Gate打金狗0Gas费 profil fotoğrafı
星烁 | Gate打金狗0Gas费4 gün önce

OCR不只是识字,能读页面才实用

Zyc profil fotoğrafı
Zyc4 gün önce

好东西真多,先收藏了再说

Miss tang|Gate打金狗0Gas费 profil fotoğrafı
Miss tang|Gate打金狗0Gas费4 gün önce

这个功能看起来真不错

GISTER OTF 💎 profil fotoğrafı
GISTER OTF 💎4 gün önce

The useful part is preserving structure, because recognizing the text means little if the relationships between formulas, tables, and fields are lost.

jestro profil fotoğrafı
jestro4 gün önce

Really solid work. The layout-aware parsing is the part that actually matters formulas, tables, and field relationships stay usable instead of turning into a dumped string of text. That’s a genuine step up from typical OCR.

Benzer Videolar

我拿 OpenAI Codex 桌面端截了一张图,丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 没拆布局,没写组件清单。 提示词就这一段: 「这是 Codex 桌面端截图。请高度还原成可运行的单文件 HTML。对齐窗口结构、侧边栏、主对话区、输入框、配色、字号、间距和圆角。能看清的文字按原样还原。先渲染一版,再和原图逐项对比,哪里不像改哪里。」 会看图写代码的模型不少。 会盯着 Codex 这种桌面客户端界面,对着自己的渲染结果改到像的,不多。 Ling-3.0-flash-VL 是百灵系列第一个原生多模态模型,在 Ling-3.0-flash 上加了视觉理解和视觉 Agent。 总参数 124B,激活大约 5.5B,支持图、文、视频,上下文 256K。 它不是看完图一次性交卷,而是走「观察 → 行动 → 验证 → 修正」: 截图还原界面,对照渲染结果自己改 当 GUI Agent,点、输、滚、切应用 看视频提问、检索片段 读文档、看医疗报告、做 STEM 视觉推理 前端这块,Image-to-WebDev Arena 成绩高于 GPT-5.4。 纯文本版 AA Index 是 38,加上视觉后到了 42。 你也试一下,3 步就够: 打开 Ling Studio,选 Ling-3.0-flash-VL(免费) 丢一张 Codex / VS Code / 你常用软件的桌面截图 把下面提示词贴进去,看它怎么还原、怎么改 还原提示词(可直接复制): 这是一张 Codex 桌面端界面截图。请把它高度还原成可直接运行的单文件 HTML。 按桌面应用还原,不要做成网页落地页,也不要做成 ChatGPT 网页版或 VS Code 对齐标题栏、侧边栏会话列表、主对话区、工具调用/代码块、底部输入框 配色、字号、间距、圆角、分割线、栏宽尽量贴近原图 原图能看清的文字按原样还原;看不清的用同等长度占位 先出第一版并渲染,再和原图对比对齐、颜色、组件位置 列出差异后改第二版,直到气质接近 Codex 桌面端 权重已开源,BF16 / FP8 都能下: Hugging Face: ModelScope: 官方介绍: Ant Ling 别只看评测表,丢一张你桌面上的截图,比什么都准。

程序员端哥

21,379 görüntüleme • 10 gün önce

无敌了,我用 30 分钟,做了个给小孩订正作业的小工具。 现在这种视觉模型,已经开始够快、够便宜,可以直接拿来干活了。 我把孩子做完的作业丢给蚂蚁百灵刚开源的 Ling-3.0-flash-VL。 我没让它直接处理图片,我让它先让它看整张作业,把错题、题目区域、手写答案的位置直接输出成坐标。 后面的程序拿着这些坐标去裁图、去手写,再整理成可以重新订正的题。 这就比单纯 OCR 有意思多了。 🔥当然,现在还远没到“干死作业 App”。 它坐标可能有偏差。 但以前这种东西,你得自己接 OCR、版面分析、错题识别,甚至训练专用模型。 现在一个通用视觉模型,30 分钟就能先把整条链路跑通。 这里也有个很容易误解的地方: 视觉模型,不等于出图模型。 Ling 这种 VLM 的视觉,是它能看图片、截图、文档、视频。 它本身不是 Image 2.5 那种负责生成像素的模型。 它擅长看懂以后,把结果变成文字、坐标、代码或者动作,然后继续干活。 Ling-3.0-flash-VL 总参数 124B,但 MoE 每 token 只激活约 5.5B。 这对 Visual Agent 很重要,极为广阔的知识,以及极低的激活,能做到又快又好。 🔥再往前一步,这种模型甚至很适合当教师模型。 先让 Ling-3.0-flash-VL 批量看作业,生成错题框、手写区域、版面结构这些坐标和标注,再用这些数据训练一个更小、更快的专用模型。 先让大模型直接干活,再让大模型教小模型干活。 这个 Demo已经完全跑通了,30 分钟能做到这一步,已经无敌了。 OpenRouter现在可以免费使用Ling-3.0-flash-VL:

实践哥 Li

83,455 görüntüleme • 5 gün önce

我拿一段只有9秒的企业会议视频测试了Ant Ling推出的Ling-3.0-flash-VL 视频不长场景也不复杂,但里面同时出现了人物动作、数据图表、电脑屏幕和白板文字,正好可以看看模型到底是在“看画面”,还是已经能够理解画面之间的关系 上传视频后,我没有提前告诉它会议主题,只要求它按照时间顺序描述人物、动作和环境,再判断会议类型 模型很快识别出画面中的4个人,其中1人站在双屏前讲解,另外3人坐在会议桌旁。它还区分出了操作电脑、记录笔记、指向图表等动作,人物数量和基本关系没有混在一起 让我比较意外的是,它不只看到了会议室和电脑,甚至还尝试读取了白板上的“Holbrook Creative Room 10:00am”以及“MAY、JUN、JUL、AUG”等文字。屏幕上的柱状图、折线图和右侧的山水画面也被分别识别出来,这说明模型处理的并非一张静态截图,而是在连续画面中寻找稳定出现的视觉线索 按照百灵官方公开的技术说明,模型会以固定帧率对视频进行采样。按每秒2帧计算,这段9秒视频理论上会形成约18个分析节点。模型需要在这些离散画面之间比较人物姿态、视线和手势变化,再组织成连贯描述 它判断第2秒至第4秒最适合用作宣传素材,理由是主讲人指向数据大屏,听众同时查看电脑并进行记录,“数据驱动决策”的企业形象在这一刻比较集中 不过,识别画面和理解业务仍然是两件事。模型可以判断这可能是一场业务复盘会、经营分析会或项目汇报会,但它无法确认图表展示的是营收、用户数量还是项目进度。 创意团队”跨部门协”等说法,也只能算基于环境和人员状态做出的推测,不能当成已经发生的事实 这种边界反而让测试更有价值 对于企业视频素材管理,它可以帮助工作人员快速描述画面、标记人物动作、定位适合剪辑的时间点,还能给视频建立便于检索的文字标签。但如果把它直接用于生成正式会议纪要,风险就会明显增加,因为画面不能替代发言内容,模糊图表也不能支撑具体经营结论 这次测试中,Ling-3.0-flash-VL给我的感觉他看懂了人物、环境、文字和动作关系,也给出了相对合理的场景判断,但它并没有真正掌握这场会议讨论了什么 它更像一名观察细致的视频助理,能够整理眼前的信息,却不能代替参与会议的人作出业务定性 更好的帮助了企业使用这类模型时,可以让它多做素材检索、镜头标注和初步整理,再由工作人员核对关键文字与业务结论 这是openrouter 的体验地址当前处于免费期,兄弟们可以去试试给他一个视频看他能否给出你想要的结果 Ling 3.0 Flash VL (free) - API Pricing & Benchmarks | OpenRouter Hugging Face: Ling-3.0-flash-VL 官方发布: GI/status/2095935971556782372

平凡的蛙里奥

48,681 görüntüleme • 3 gün önce

Codex 做 PPT 合集:15 个 Skills 和开源方案,按用途整理好了 我现在做 PPT,基本都交给 AI,下面把课件、汇报、生图和图片转 PPT 的方案列出来,效果看视频,网址直接放在每项下面。 一、自己讲课、演讲、做分享 1)Marp 把文字和图片整理成课件,后续换案例、补内容,改源文件就能重新生成。适合常规培训,默认导出的 PPTX 是图片式。 2)Slidev 适合讲代码、公式和操作过程,支持分步动画和网页互动。让 Codex 整理逐页内容,再补演示效果;交互多了,也需要多调试。 3)归藏 guizang-ppt-skill 电子杂志、瑞士国际主义等风格,适合整套分享保持统一。先选风格、试一页正文,再继续做;主要用浏览器播放。 4)张咋啦 frontend-slides 先出视觉样张,再选字体、配色和布局,适合想跳出固定模板的分享。输出以 HTML 为主,离线播放前检查字体和图片。 二、做汇报、答辩,交给客户继续改 1)ppt-master 把页面做成可编辑的文字、形状,也支持部分原生图表和表格。先让 Codex 试做正文和数据页,导出后改一个数字,看看图表是否跟着变。 2)slide-skill 提供主题和模板流程,适合反复制作同类汇报。内容更新后可以重新生成,中文断行、字号和图表编辑能力要检查。 3)deck-dna 给两三份认可的旧 PPT,提炼字号、配色和布局,再做新稿。适合沿用公司风格;有严格母版要求,仍要保留原模板。 三、做科普、知识卡和图文课件 1)宝玉 baoyu-slide-deck 黑板、水彩等风格,背景、插画和文字整页生成。先定文案再生图,效果直观,但改字可能要重做一页。 2)宝玉 baoyu-design 先用 HTML 调整设计,再按对应流程导出,也包含可编辑 PPTX 的导出方式。需要配套工具,不能把任意网页直接无损转成 PPT。 3)PPTAgent 把论文、报告接到材料解析、大纲规划和页面生成流程里。长材料可以试,配置比单个 Skill 多,生成的结论和数字要对回原文。 四、只有图片或 PDF,想继续修改 1)GordenSuperPPTSkills 通过 Image2PPTX 相关流程拆文字、补背景、分离元素,适合拿现成图片改标题、挪配图。部分对象仍是图片,不会全部变成原生图形。 2)LRriver/AIPPT 在一个工作台里生成图片、拆分和编辑,少一些导出再导入。效果取决于接入的服务,正式使用前先试一页。 3)NBLM2PPTX 分离 PDF 页面的文字和背景,再组装成 PPTX。没有源稿、只想改字时可以试,复杂图表可能仍保留为图片。 五、想在界面里管理整套制作过程 1)codex-slides 先改大纲、顺序和风格,再生成页面,适合边看边调整。它偏图片式制作,不适合需要频繁更新表格数据的文件。 2)Presenton 模板、模型接入、编辑和导出放在一起,适合长期反复做 PPT。让 Codex 协助搭建,部署和模型费用需要自己管理。 日常课件用 Marp,需要互动再用 Slidev;正式交付用指定模板加 ppt-master;知识卡用宝玉整页生图;只有图片、没有源稿时,再用 Gorden 拆。 建议先做封面、正文和最复杂的一页,满意了再做整套

Miles Ma

32,573 görüntüleme • 15 gün önce

这两天看到我一直很喜欢的设计师阿哲 阿哲Phil 的个人网站,我挺喜欢他个人主页的那个风格。 看着看着突然冒出一个念头: 这种个人审美很强的网站,模型光看录屏,能不能做出来? 于是我顺手录了 10 秒左右,从页面上划过去,直接把视频丢给 Ling-3.0-flash-VL,让它照着做一版。 没给源码,也没拆页面,更没写一大段提示词。输入就那段录屏,加上一句很简单的需求。其实扔进去的时候,我没抱多大期待。视频一晃就过去了,有些细节让我自己暂停看,也未必记得住。 Ling-3.0-flash-VL 是百灵在 Ling-3.0-flash 上加了视觉理解和 visual agent 的版本。官方提到的能力挺多,视觉感知、STEM、文档、前端编码、医疗报告都在里面。我这次没全测,就看一件事:它能不能看完一段网站录屏,真把页面做出来。 结果打开以后,我确实愣了一下。 按肉眼看,和阿哲的原版大概有七成像。大的版式、配色和页面感觉都抓到了,生成出来的也不只是一个摆着看的空壳。按钮能点,交互能跑,放进浏览器里,已经像个可以接着改的半成品。 当然,剩下那三成也挺明显。风格不够细腻,字体没那么贴,交互还是有点僵,一些细节只学到了大概。把两个页面并排放在一起,差距还是能看出来。要我直接拿去上线,我肯定不会;拿它当第一版,我觉得够了。 以前脑子里有个页面的样子,最麻烦的是说不清。你跟开发说想要“有点设计感”“交互顺一点”,讲了半天,对方可能还是不知道你想要什么。自己不会写代码的话,很多想法就一直停在收藏夹里。 现在简单多了。先找一个接近自己想法的网站,录一小段,让模型搭出来。哪里不对,直接看着页面改。它没有把阿哲的网站原样搬过来,但它把一张白纸直接做到了七成。 所以这次测完,我还挺愿意安利 Ling-3.0-flash-VL。离专业前端当然还有距离,但对没代码基础、想做个人网站或者产品 Demo 的人来说,先把第一版弄出来,已经能省不少事了。 感兴趣的都可以去试一试:

阿川 | AI thinking

33,284 görüntüleme • 7 gün önce

飞书+豆包这个组合真的太牛逼了!自从豆包和飞书集成之后,结合抖音的字节生态,可以直接提取某个抖音博主的(don哥、李守洲等人)逐字稿了 如果你觉得一个博主的方法论特别有用,那你就可以和豆包说直接把它提取出来,并分门别类进行多维表格化的整理 你就会发现他变成一组数据进入到你的飞书了 我这次用飞书里的豆包,做了一件原来很烦的事,并最后形成了一套用AI做选题的方法论 我这次抓 20 个“用 AI 做选题”的视频,直接把这些视频的内容转成逐字稿,再放进飞书多维表格里 这件事我一开始是没想到的,因为按原来的做法,你想拆一个视频的方法论,基本就是:用Get笔记复制一下项目链接,再复制再粘贴,最后拿到的东西很散 说豆包和飞书这次结合起来,我就直接把任务派给了豆包,看视频就行了 我把任务丢给豆包「先抓 20 个 AI 找选题相关视频」 再把视频内容转成逐字稿,然后落到飞书多维表格里,继续做分类、提炼、整理 最后出来了 3 个交付物,这些我觉得都很实用: 一张原始素材表:20 条视频记录,带逐字稿、点赞数据和视频链接 一张方法论整理表:32 条方法论,拆成 5 大类,做了 13 个字段 一篇约 6000 字的文章:从工具使用者到系统构建者的五层进阶 这才是我觉得飞书里的豆包最适合内容创作者的地方,这也是它和WorkBuddy等仅仅切入B端市场不同的地方,就是它真的在照顾每一个使用飞书的人,每一个使用字节产品的人,把生态打造成了一个绝对的壁垒 它能把“找素材”和飞书结合起来,往后推进成一个可以继续用的工作台 最有意义的就是它先帮我把别人视频里的有效表达扒出来 再把这些逐字稿变成结构化表格,再从表格里提炼方法论 最后沉淀成一篇可以发出去的文章,甚至可以反过来做成一个“AI 找选题方法论”的 skill 这条链路很像我最近一直在讲的那句话:AI 内容创作不是生成,而是消化 而豆包进入飞书表格之后,飞书多维表格在这里就不是普通表格了 它更像一个内容生产的中控台:原始素材、逐字稿、方法分类、适用场景、后续文章,都能接在一起,还有更多玩法,我后面慢慢来更新 飞书还有各类免费的直播课!想听的直接扫描评论区的二维码及时接收提醒,量大管饱!!!

叫我阿杭

36,623 görüntüleme • 1 ay önce

中文创作者开源的 AI Skill,挑了 5 个我觉得写内容真能用上的。 ① Humanizer-zh:去 AI 味 这个是 op7418 汉化的,它不是简单让文字“更口语化”,而是专门帮你抓文章里的 AI 痕迹。 比如:过度强调意义、万能结尾、虚假范围、填充短语、空泛总结。 这些东西单独看没问题,但堆在一起,读者一眼就能看出“这味儿不对”。 写完推文、公众号、小红书,丢进去过一遍,能把那种模板感压下来。 ② dbskill:选题诊断 + 爆款标题 dontbesilent 做的,一套 21 个 skill,这个比较狠,它不是单纯教你“怎么写得更好”,而是帮你拆:为什么这个选题没人点?为什么标题没吸引力?为什么内容看完没记忆点? 里面有选题分析、对标拆解、小红书标题公式、AI 痕迹扫描。 据说是从一万两千多条推文里提炼出来的,不是那种空泛方法论,更像一个内容创作者自己的实战经验库。 适合经常卡在“我知道要写,但不知道怎么切角度”的人。 ③ NotebookLM Skill:用自己的资料库写内容 这个连的是 Google NotebookLM,我觉得它最适合写长文、研报、项目解析、信息整理类内容。 它的价值不是让 AI 写得更花,而是让 AI 不要乱编,你把资料上传进去,Agent 基于你的资料库回答,每条内容都能带引用,写需要信息准确的东西时,这个很重要。 尤其是加密、AI、开源项目、行业分析这种内容,最怕的不是写得慢,而是写错了还不知道。 ④ khazix-skills:卡兹克的写作套件 数字生命卡兹克把自己的写作节奏和分析方法做成了 skill,最有意思的是“横纵分析法”。 你丢一个产品、公司或者项目进去,它能拉出一份很完整的研究报告。 适合做:项目拆解、公司分析、产品研究、长文选题预研。 里面还夹了一个 storage-analyzer,可以扫 Mac 磁盘,用三色分级告诉你哪些能删、哪些别乱动。 这个就很创作者真实工作流,不只是写作,还包括电脑里那堆素材和缓存怎么清。 ⑤ ian-xiaohei-illustrations:正文配图 这个不是信息图,也不是那种商业插画模板。 它的风格是白底黑线手绘,一个叫“小黑”的角色,加少量红橙蓝中文批注。 16:9 横版,一张图只讲一个判断,我觉得它很适合放在公众号、长推、小红书里。现在内容配图要么是截图,要么是 AI 感很重的视觉图,看多了都差不多。 这种怪诞手绘风反而有辨识度。

撸毛吃猪脚饭|Gate美股0费率

31,665 görüntüleme • 3 ay önce

一直以来,学英语对我来说都是一件挺痛苦的事🥺 大家都说: 看美剧、背单词、每天坚持听英语…… 但这些方法到我这里好像都不太行 听不进去,背了又忘 而且我现在对英语的需求,也早就不是为了考试、死记硬背了 我更想要的是: 能正常开口交流,别人聊天的时候,大概能听懂他们在说什么。 但学了这么久,好像一直没有特别明显的变化 这个其实挺让我焦虑的😭 —————— ฅ՞• •՞ฅ —————— 但半个月前,我发现了一个对我来说更高效的方法: 在 YouTube 上看 Ariannita la Gringa 这种生活英语频道 她不是那种很死板地讲语法、背单词的老师 而是直接结合真实场景教英语 麦当劳怎么点餐 机场安检怎么说 星巴克怎么点咖啡 餐厅怎么跟服务员交流 在美国吃饭、小费到底该怎么给 我发现放到具体场景以后,很多表达突然就没那么难记了 场景 + 动作 + 中文意思 记忆反而比单独背单词要深很多 —————— ฅ՞• •՞ฅ —————— 刚好最近又被朋友种草了 沉浸式翻译 沉浸式翻译 我现在看这些英语视频,基本都会直接开中英双语字幕 一句英文出来,下面马上能看到中文。 不懂的时候看一眼,懂的时候就继续听。 有些 YouTube / X 视频本身连字幕都没有,它还可以直接用 AI 补字幕 这种方式对我来说真的比死背有意思太多了😭 我一开始只是拿它来辅助学英语,后来才发现,沉浸式翻译其实还有很多日常刚需功能 我平时每天都会刷很多英文 X、AI / Crypto 资讯和海外网站。 以前要经常在网页、截图、翻译器、ChatGPT 之间来回切换 现在很多时候点一下右边的小图标就能解决 阅读节奏就不会一直被打断了 —————— ฅ՞• •՞ฅ —————— 最近它的几个功能里,我最喜欢这两个: 第一个是 BabelFast 主要就是一个字: 快 尤其看长网页、技术文档和论文的时候,我其实不在乎背后用了什么模型。 我只在乎: 我往下看的时候,翻译能不能跟得上? 看到一半停下来等翻译,真的很容易把思路等没了 第二个是圈选翻译 网页文字还好,最烦的是图片、截图、PPT、图表里突然冒出来几行英文 现在直接点一下就能翻 我觉得它有点像以前“划词翻译”的加强版, 特别适合看梗图、信息图、产品截图、论文图表。 如果你也像我一样,每天都要刷很多海外信息、看视频、读论文和技术资料 那 BabelFast、AI 字幕、Babeldoc 这些 Pro 功能,是真的帮你省时间 以前看到英文: 复制 → ChatGPT → 翻译 现在很多时候: 点一下右边的小图标,就解决了 这可能才是我最需要的状态: 不是等英语学好了再去看世界,而是一边看世界,一边把英语慢慢学会

Nana

44,506 görüntüleme • 22 gün önce

1/2) 最近看到一个有意思的技术趋势:大家又开始重新拥抱 Native 了。 Shopify 刚刚宣布,要把移动 App 从 React Native 重新迁回 Swift 和 Kotlin。 更夸张的是,在 Coding Agent 的帮助下,他们只用了 12 周,就把 Shop 从 概念验证做成了已经上架 App Store 的原生应用。 Shopify 给出的理由很直白: 以前选择跨平台,是因为“同一个功能写两遍”太贵。 Notion 其实更早就在走这条路。 它的移动端曾经大量依赖 WebView / React Native,后来为了启动速度、交互体验和系统级控制,一点点把核心界面迁到了原生。 现在也宣布,完全用原生方式重建 Notion 的移动端应用。 why? 因为现在 AI Coding 能力是越来越强,原生开发最大的成本劣势正在快速消失。 所以我最近 Vibe Coding 一个 AI 工具的时候,没有 Electron,没有网页套壳。 我直接就是做成了一个 macOS 原生的实时视觉 AI 助手。 它想解决的问题非常简单: 以前你想问 AI: “右上角那个按钮是什么意思?” “这个公式怎么推出来的?” “第三行这个数字占总数多少?” 你首先得花半天跟 AI 描述—— “我到底在看哪里。” 现在不用了。 在 Mac 上按下快捷键,直接在当前屏幕上: 截图 → 画圈 / 框选 / 箭头标记 → 提问。 AI 直接看懂你指的是哪里,然后秒级流式回答。 整个过程不用切 App,也不需要把截图保存下来,再拖进 ChatGPT。 看到哪里,问到哪里。 一个视觉 AI 助手如果每天要被唤起几十次,它就不应该像一个“网页工具”。 它应该像 Spotlight、截图工具一样,长在操作系统里。 而驱动这个助手的,是蚂蚁百灵刚刚开源的: Ling-3.0-flash-VL。 实际跑下来,我测试了几个特别适合这种 Native + Vision 交互的场景。 ━━━━━ ✨ 场景 1:看到外语,直接圈 碰到英文文档、论文、国外软件界面: 不用复制文字。 直接把屏幕上的区域圈出来,问: “这段是什么意思?” Ling-3.0-flash-VL 会同时利用视觉位置和文字内容进行理解,再把结果流式返回。 相当于给 Mac 加了一个随时可以召唤的视觉翻译层。 ━━━━━ ✨ 场景 2:看到公式,直接问 看论文时遇到复杂的微积分公式、上下标、符号关系: 直接框起来: “给我讲明白这个公式。” 它不仅要 OCR 出字符,还需要理解公式的结构。 实际测试里,它可以继续解释定理、变量含义、推导过程,再用大白话重新讲一遍。 以前是: 截图 → 保存 → 上传 → 描述问题。 现在就是:圈一下。 ━━━━━ ✨ 场景 3:看到数据,直接算 表格可能才是这个交互方式最爽的地方。 我直接用画圈和箭头标出表格里的一个商品,然后问它占比是多少。 它马上识别出我指的是“桃子”,再结合整张表里的数字完成计算: 桃子的销量占比:16.7%。 这里实际上连续做了三件事: 视觉定位 → 语义理解 → 数值计算。 而用户只做了一件事:圈。 ━━━━━ 但 Ling-3.0-flash-VL 真正让我感兴趣的,其实不只是“看图问答”。 它本身就是冲着 长程多模态 Agent 去设计的。 ⚙️ 124B 总参数,单 Token 仅激活 5.5B 采用稀疏 MoE 架构。也就是说,它不是靠把一个巨大的 124B Dense 模型每次完整跑一遍来工作,而是在每次推理时只激活其中一部分专家。 目标就是: 把大模型容量和实时推理效率同时保留下来。 ⚡ 视觉不是外挂,而是原生进入推理链 它原生支持图片、文字和视频。 ViT 负责视觉编码,再把视觉信息真正送进后面的理解、推理、行动与验证流程。 这点很重要。 因为未来的视觉 Agent,并不是: 看图 → 回答一句话。 而应该是: Observe → Act → Verify → Correct 看见界面 → 执行操作 → 再看结果 → 发现错误 → 自己修。 这才是 GUI Agent 真正需要的能力。 📚 256K 长上下文,面向复杂多模态任务 这意味着它不只是适合单张截图问答,也能一次处理更长的文本、更复杂的多图输入,以及持续时间更长的视觉信息。 同时,它还加入了 VideoRoPE 时空编码,让模型不仅能理解“画面里有什么”,还能够结合时间顺序去判断: 什么事情,在什么时候发生。 所以它可以进一步用于长视频理解、事件检索、片段定位,以及更复杂的多模态 Agent 工作流。 对我这个 Mac 原生助手来说,这一点也很重要: 未来它不一定只理解“你刚刚圈的这一块”,还可以结合前后的屏幕内容、历史操作和上下文,持续理解你正在做什么。 💻 对 Agent 和代码生成尤其友好 这也是为什么我觉得它特别适合这个 Mac 助手。 它不仅能够理解: ⭕ 圆圈 ➡️ 箭头 🟨 高亮 ▢ 框选 这些人为添加的视觉提示, 还可以直接: 看 UI → 理解布局 → 写 HTML / CSS / SVG → 再看生成结果。 如果再给 Agent 接一个 Image Diff: 生成页面 ↓ 截图 ↓ 和目标图对比 ↓ 发现偏移 ↓ 修改代码 ↓ 再次截图验证 就可以做出完整的: 「生成 → 看结果 → 对比 → 修改」视觉自愈闭环。 ━━━━━ 而且 Ling-3.0-flash-VL 最近又更新了两个非常关键的东西。 ① API 可以免费玩 Ling-3.0-flash-VL 现在已经上线 OpenRouter, 官方最新活动是:两周免费使用。 所以想复刻类似的视觉 Agent,基本可以直接拿 API 开始测试。 ② 模型已经开源,而且量化版本也补齐了 也就是说,你既可以直接调用 API, 也可以根据自己的硬件环境,选择不同精度版本自己部署。 这对本地视觉 Agent 尤其重要: 云端 API 是最快的起点,本地模型才是隐私和系统级 AI 的终局之一。 ━━━━━ 所以我越来越觉得: Shopify 从 React Native 回到 Swift/Kotlin,其实不只是一次技术栈轮回。 背后更大的变化是: AI 正在重新改写“原生开发到底贵不贵”这笔账。 以前: 跨平台 = 开发快。 原生 = 成本高,但体验好。 现在 Coding Agent 开始承担大量重复实现、迁移、测试和 Review 之后, 这个公式可能变成: AI Coding + Native = 开发效率 + 原生体验。 而视觉模型又给 Native App 增加了一层新的可能: 它不只是“一个带 AI 的应用”。 AI 可以开始直接理解你正在使用的整个操作系统。 以前是: 人费劲地告诉 AI:我在看什么。 以后可能只需要:划个圈。 它就懂了。 附录链接👇

前端哥Liam

24,317 görüntüleme • 7 gün önce

看我作为一个 AI 博主是如何用飞书 + 【可联网的】DeepSeek R1 搭建简单自动化工作流提升工作效率的 作为一个 AI 博主,日常一大部分工作是阅读和分享各种海外的AI资讯,这就少不了要翻译各种英文文章。之前我很多操作是手动的,比如复制粘贴文章到 Markdown 编辑器,然后从编辑器复制到 DeepSeek R1 或者 ChatGPT 去翻译,再改写后发布。 之前看 orange ai 分享的飞书多维表格接入 DeepSeek R1 的教程,【加上这周飞书的AI直播】,按照我自己的场景定制了几个工作流,最开始只是简单的文本翻译,后来发现也能用支持从图片提取文字,那意味着我可以直接先把图片转成文字,再基于翻译好的文本用 DeepSeek R1 翻译。简单设置后就成功了。 再后来我甚至更进一步,直接从 URL 抓取内容,然后借助 DeepSeek R1 翻译,最后甚至还可以把翻译后的文章用各种不同的文章风格改写,使用的时候只要输入 URL 就可以自动生成一篇高质量的文章,是真的很方便。 具体来说,就是飞书在添加字段的时候,可以选 ShortCuts(中文可能对应的是“快捷方式”),然后从快捷方式中选择各种不同的工具,比如说 AI 抓取、DeepSeek R1、图片 OCR、图片生成、抠图等等,并且你可以设置某个字段的内容为输入,以及自定义提示词。 就像我前面自动从 URL 生成文章的流程,主要有这样几个字段: - URL:输入 URL - 原始网页内容(AI Web Link Reader):从输入的 URL 中提取标题、内容为 Markdown 文本 - 翻译为中文(DeepSeek R1):将抓取后的 Markdown 文本翻译为中文 - 翻译为中文 - 输出结果:DeepSeek R1 的输出结果 - 风格改写(DeepSeek R1):将翻译后的内容用指定的风格改写,阅读起来更自然 - 风格改写 - 输出结果:DeepSeek R1 的输出结果 除了上面的 URL 生成文章外,里面还包含了几个不同的常用工作流: - 将输入的文本内容翻译为中文 - 将输入的图片内容翻译为中文 - 生成多条爆款标题供选择 工作流的飞书模板链接🔗我放在了评论,建议你也可以试试,应该可以发掘出不少有意思的场景。⬇️

宝玉

87,558 görüntüleme • 1 yıl önce