前端哥Liam's banner
前端哥Liam's profile picture

前端哥Liam

@jinglian8,162 subscribers

11年前端开发者 & AI 重度用户| AI工具 + X运营,我踩过的坑都帮你避开| vx:qian_duan_ge

Shorts

1/2) 宇树刚上市,市值达 3000 多亿,王兴兴为啥没有一张照片是笑的? 是表情管理太强,还是宇树的业绩藏着水分? 为了扒出真相,我派出了 AI 分析师去“查账” 👇 我用的核查组合是:PI Agent ➕ Ling-3.0-flash-Fin 「蚂蚁百灵」刚发布的这个金融开放模型,简直是为扒财报量身定制的: 👉 PI Agent:负责当“手脚”,调用搜索、网页和 Python,跑长链路核验和计算。 👉 Ling-3.0-flash-Fin:它负责充当金融研究的“大脑”,是一款专为增强现实世界金融工作流程而打造的模型。模型总参数量达 1240 亿,采用 MoE 架构,每次推理激活 51 亿参数,并支持 256K 上下文窗口。 核查结果如何呢?👇 我给它布置了硬核任务: 「调研宇树科技 2023—2025 年人形机器人商业化进展」 实测下来,它的材料纪律性极其专业: ✅ 一级来源:只认官方澄清、申报稿和注册稿。 ✅ 二级来源:新闻资讯只当线索,绝不盲目采信。 绝不是市面上那种随便扒两篇新闻,凑个「5500台」就敢出报告的水平。 更可怕的是它的交叉验证和逻辑推理能力。 它把产量、出货量、销量、订单量全部拆开,还把总收入除以销量,把均价(59.34、26.04、16.64)精准验算了一遍。 面对【6500台下线 vs 5716台产量】这种口径对不上的数据,它选择保留疑点“不硬圆谎”。这才是真分析师该有的素养。 下方的图片,是 6 页 PDF 报告的第一页。完整实测过程见下方视频。

1/2) 宇树刚上市,市值达 3000 多亿,王兴兴为啥没有一张照片是笑的? 是表情管理太强,还是宇树的业绩藏着水分? 为了扒出真相,我派出了 AI 分析师去“查账” 👇 我用的核查组合是:PI Agent ➕ Ling-3.0-flash-Fin 「蚂蚁百灵」刚发布的这个金融开放模型,简直是为扒财报量身定制的: 👉 PI Agent:负责当“手脚”,调用搜索、网页和 Python,跑长链路核验和计算。 👉 Ling-3.0-flash-Fin:它负责充当金融研究的“大脑”,是一款专为增强现实世界金融工作流程而打造的模型。模型总参数量达 1240 亿,采用 MoE 架构,每次推理激活 51 亿参数,并支持 256K 上下文窗口。 核查结果如何呢?👇 我给它布置了硬核任务: 「调研宇树科技 2023—2025 年人形机器人商业化进展」 实测下来,它的材料纪律性极其专业: ✅ 一级来源:只认官方澄清、申报稿和注册稿。 ✅ 二级来源:新闻资讯只当线索,绝不盲目采信。 绝不是市面上那种随便扒两篇新闻,凑个「5500台」就敢出报告的水平。 更可怕的是它的交叉验证和逻辑推理能力。 它把产量、出货量、销量、订单量全部拆开,还把总收入除以销量,把均价(59.34、26.04、16.64)精准验算了一遍。 面对【6500台下线 vs 5716台产量】这种口径对不上的数据,它选择保留疑点“不硬圆谎”。这才是真分析师该有的素养。 下方的图片,是 6 页 PDF 报告的第一页。完整实测过程见下方视频。

345,948 просмотров

Videos

jinglian's profile picture

传统的 Deep Research 已经卷到头了。 能写出一份漂亮的总结报告 ≠ 能把真实的复杂任务干完。 我拿几十万字的《红楼梦》原著,给 Apodex 1.1 在线工作台,出了个极其变态的任务。 统计 20 个核心人物的 → 出场次数 → 出场回数 → 每个人第一次出场时的原句 最后还要整理成一张可以直接下载的完整表格。 整个完成任务的过程,像是直接「雇佣一个 AI 数据团队」。 上传文件后,它自己开始拆任务。 一个 Agent 负责解析原著,另一个独立分析,多个任务并行推进; 右侧 Task Board 会实时告诉你现在做到哪一步。 更有意思的是,任务跑到一半,我突然改需求: “只分析前 80 回,后面的不要了。” 以前遇到这种情况,AI 很可能重新来一遍。 Apodex 直接保留已经完成的成果,只重规划受影响的部分。 更关键的是,它不是做完就交卷。 交付前,又调起独立核验 Agent,把人物统计、出场回数和 900+ 条出场原句重新检查一遍。 最后交付给我的是: 可下载的结构化表格 + 完整分析结果 + 口径说明。 这可能才是下一代 Deep Research 真正值得关注的变化: 从“帮你生成一份报告”,变成“接管一项复杂任务,并把它做完”。 目前,Apodex 1.1 Web 端已经正式上线。 🎁 注册即送 credits,强烈建议立刻上传个复杂文件自己跑跑看: 🌐 没想到,更炸裂的是,Apodex 居然开源了 开源模型: Apodex 1.1 mini,35B,开放模型权重,支持本地部署。 开源框架: FrontierAgent,Agent 执行 Harness,支持 ReAct 单 Agent + Multi-Agent Team。 本地运行: 支持 macOS / Linux,无需强制依赖 Docker。 组合能力: Apodex 1.1 mini + FrontierAgent,可在本地运行完整 Agent 执行流程。 💻 如果你是开发者,这里有开源 Agent 框架,欢迎顺手点个 ⭐: 👉 🤗 想本地自己跑模型的看这里👇 #Apodex #DeepResearch

前端哥Liam

108,599 просмотров • 28 дней назад

jinglian's profile picture

卧槽,GPT-6 Astra 的蜜月期也太短了吧。 爽了不到一周,就从“小甜甜”变成“牛夫人”了。 熟悉的剧情再次上演:刚让你产生依赖,降智,速率限制就开始逼你戒断。 偏偏 Deadline 已经顶到脑门,我还有一堆任务没跑完,只能紧急把部分工作搬到 Claude Code 和 Cursor。 但现实很骨感:Agent 可以随时切,【上下文】和【记忆】却带不走。 为了解决这个问题,我最近开始折腾一个很有意思的开源项目:Memmy。 它想解决的问题很直接: 把散落在 Codex、 Claude Code等不同 Agent 里的经验抽出来,沉淀成真正属于我们自己的长期资产。 这样,昨天 Codex 踩过的坑,今天换成 Claude Code 就不用再踩一遍;项目背景、失败方案和关键决策,也不用每换一个工具就重新解释。 ━━━━━ Memmy 不只是一个本地个人 AI Agent,更像是多个 Agent 共用的「个人记忆中枢」。 只要获得你的授权,Memmy 就会自动扫描 Codex、 Claude Code等工具的历史记录。 它能把过去的历史,精准转化为可查询、可复用的长期记忆: 1️⃣ 项目核心背景 2️⃣ 关键技术决策 3️⃣ 你的个人偏好 4️⃣ 踩过的血泪坑 最让我惊喜的是,Memmy 让各个独立的 Agent 变成了配合默契的「一家人」。 以前大家各干各的,现在基于同一份用户上下文,一个 AI 学会的东西,下一个 AI 直接用! 更重要的是,这份记忆只属于【你】,而不是某个 AI 。 Memmy 默认 Local-first: ✅ 你的记忆你做主,自由决定连接和保留哪些数据 ✅ 换 Agent、换模型,上下文数据直接打包带走 它不仅是 Memory Layer,还是 Personal Agent Runtime,支持桌面端、CLI/TUI 甚至工具直连执行任务。 ━━━━━ 如果你也是多 Agent 重度用户,强烈建议把过去几个月积累的上下文导进去跑一遍,看看下一个 Agent 能不能真正「接着干」。 Memmy 目前已开源,完美支持 Claude Code, Codex,Cursor, Hermes, OpenClaw, DeepSeek Harness 等。 👉 GitHub 传送门: 别忘记福利🎁 👇

前端哥Liam

20,650 просмотров • 7 дней назад

jinglian's profile picture

1/2) 最近看到一个有意思的技术趋势:大家又开始重新拥抱 Native 了。 Shopify 刚刚宣布,要把移动 App 从 React Native 重新迁回 Swift 和 Kotlin。 更夸张的是,在 Coding Agent 的帮助下,他们只用了 12 周,就把 Shop 从 概念验证做成了已经上架 App Store 的原生应用。 Shopify 给出的理由很直白: 以前选择跨平台,是因为“同一个功能写两遍”太贵。 Notion 其实更早就在走这条路。 它的移动端曾经大量依赖 WebView / React Native,后来为了启动速度、交互体验和系统级控制,一点点把核心界面迁到了原生。 现在也宣布,完全用原生方式重建 Notion 的移动端应用。 why? 因为现在 AI Coding 能力是越来越强,原生开发最大的成本劣势正在快速消失。 所以我最近 Vibe Coding 一个 AI 工具的时候,没有 Electron,没有网页套壳。 我直接就是做成了一个 macOS 原生的实时视觉 AI 助手。 它想解决的问题非常简单: 以前你想问 AI: “右上角那个按钮是什么意思?” “这个公式怎么推出来的?” “第三行这个数字占总数多少?” 你首先得花半天跟 AI 描述—— “我到底在看哪里。” 现在不用了。 在 Mac 上按下快捷键,直接在当前屏幕上: 截图 → 画圈 / 框选 / 箭头标记 → 提问。 AI 直接看懂你指的是哪里,然后秒级流式回答。 整个过程不用切 App,也不需要把截图保存下来,再拖进 ChatGPT。 看到哪里,问到哪里。 一个视觉 AI 助手如果每天要被唤起几十次,它就不应该像一个“网页工具”。 它应该像 Spotlight、截图工具一样,长在操作系统里。 而驱动这个助手的,是蚂蚁百灵刚刚开源的: Ling-3.0-flash-VL。 实际跑下来,我测试了几个特别适合这种 Native + Vision 交互的场景。 ━━━━━ ✨ 场景 1:看到外语,直接圈 碰到英文文档、论文、国外软件界面: 不用复制文字。 直接把屏幕上的区域圈出来,问: “这段是什么意思?” Ling-3.0-flash-VL 会同时利用视觉位置和文字内容进行理解,再把结果流式返回。 相当于给 Mac 加了一个随时可以召唤的视觉翻译层。 ━━━━━ ✨ 场景 2:看到公式,直接问 看论文时遇到复杂的微积分公式、上下标、符号关系: 直接框起来: “给我讲明白这个公式。” 它不仅要 OCR 出字符,还需要理解公式的结构。 实际测试里,它可以继续解释定理、变量含义、推导过程,再用大白话重新讲一遍。 以前是: 截图 → 保存 → 上传 → 描述问题。 现在就是:圈一下。 ━━━━━ ✨ 场景 3:看到数据,直接算 表格可能才是这个交互方式最爽的地方。 我直接用画圈和箭头标出表格里的一个商品,然后问它占比是多少。 它马上识别出我指的是“桃子”,再结合整张表里的数字完成计算: 桃子的销量占比:16.7%。 这里实际上连续做了三件事: 视觉定位 → 语义理解 → 数值计算。 而用户只做了一件事:圈。 ━━━━━ 但 Ling-3.0-flash-VL 真正让我感兴趣的,其实不只是“看图问答”。 它本身就是冲着 长程多模态 Agent 去设计的。 ⚙️ 124B 总参数,单 Token 仅激活 5.5B 采用稀疏 MoE 架构。也就是说,它不是靠把一个巨大的 124B Dense 模型每次完整跑一遍来工作,而是在每次推理时只激活其中一部分专家。 目标就是: 把大模型容量和实时推理效率同时保留下来。 ⚡ 视觉不是外挂,而是原生进入推理链 它原生支持图片、文字和视频。 ViT 负责视觉编码,再把视觉信息真正送进后面的理解、推理、行动与验证流程。 这点很重要。 因为未来的视觉 Agent,并不是: 看图 → 回答一句话。 而应该是: Observe → Act → Verify → Correct 看见界面 → 执行操作 → 再看结果 → 发现错误 → 自己修。 这才是 GUI Agent 真正需要的能力。 📚 256K 长上下文,面向复杂多模态任务 这意味着它不只是适合单张截图问答,也能一次处理更长的文本、更复杂的多图输入,以及持续时间更长的视觉信息。 同时,它还加入了 VideoRoPE 时空编码,让模型不仅能理解“画面里有什么”,还能够结合时间顺序去判断: 什么事情,在什么时候发生。 所以它可以进一步用于长视频理解、事件检索、片段定位,以及更复杂的多模态 Agent 工作流。 对我这个 Mac 原生助手来说,这一点也很重要: 未来它不一定只理解“你刚刚圈的这一块”,还可以结合前后的屏幕内容、历史操作和上下文,持续理解你正在做什么。 💻 对 Agent 和代码生成尤其友好 这也是为什么我觉得它特别适合这个 Mac 助手。 它不仅能够理解: ⭕ 圆圈 ➡️ 箭头 🟨 高亮 ▢ 框选 这些人为添加的视觉提示, 还可以直接: 看 UI → 理解布局 → 写 HTML / CSS / SVG → 再看生成结果。 如果再给 Agent 接一个 Image Diff: 生成页面 ↓ 截图 ↓ 和目标图对比 ↓ 发现偏移 ↓ 修改代码 ↓ 再次截图验证 就可以做出完整的: 「生成 → 看结果 → 对比 → 修改」视觉自愈闭环。 ━━━━━ 而且 Ling-3.0-flash-VL 最近又更新了两个非常关键的东西。 ① API 可以免费玩 Ling-3.0-flash-VL 现在已经上线 OpenRouter, 官方最新活动是:两周免费使用。 所以想复刻类似的视觉 Agent,基本可以直接拿 API 开始测试。 ② 模型已经开源,而且量化版本也补齐了 也就是说,你既可以直接调用 API, 也可以根据自己的硬件环境,选择不同精度版本自己部署。 这对本地视觉 Agent 尤其重要: 云端 API 是最快的起点,本地模型才是隐私和系统级 AI 的终局之一。 ━━━━━ 所以我越来越觉得: Shopify 从 React Native 回到 Swift/Kotlin,其实不只是一次技术栈轮回。 背后更大的变化是: AI 正在重新改写“原生开发到底贵不贵”这笔账。 以前: 跨平台 = 开发快。 原生 = 成本高,但体验好。 现在 Coding Agent 开始承担大量重复实现、迁移、测试和 Review 之后, 这个公式可能变成: AI Coding + Native = 开发效率 + 原生体验。 而视觉模型又给 Native App 增加了一层新的可能: 它不只是“一个带 AI 的应用”。 AI 可以开始直接理解你正在使用的整个操作系统。 以前是: 人费劲地告诉 AI:我在看什么。 以后可能只需要:划个圈。 它就懂了。 附录链接👇

前端哥Liam

24,317 просмотров • 9 дней назад