Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

太爽了!终于找到了JEV的最强应用场景之一--全自动化 Browser use 我用JEV全自动填完 TypeSafe AI 的申请问卷,我只给它丢了一个完全陌生的网址,让它全自动帮我完整填完:38 秒一次性刷完 16 道题,全程没停顿、零人工干预 具体的逻辑是: 我看到 TypeSafe AI 文档里一句话很有启发:“将 AI 与可靠的软件相结合,这样就可以在后台无限次地运行该系统,而无需人工干预。” 所以JEV最强的应用场景之一就是做全自动化! 很多自动化慢得像幻灯片,就是因为把流程控制、视觉和思考全堆给大模型,大模型要思考推理,根本不可能跑得快 我的解法很简单:用 JEV 专职负责判断,再搭配一个高速小模型推理(我用的是DeepSeek V4.1 Flash)👇 比如这个问卷填写:遇到新页面,由 JEV 毫秒级快速判定“这里该做什么”(是勾选、点击还是提交);一旦需要填空,由 小模型(DeepSeek )极速响应生成文字填进去, 两者一结合,各司其职,不仅速度快到飞起,而且每一步都极其准确 当然这只是一种思路,可玩性实在太大了,目前我还在测更多复杂场景,马上开源给大家!Diogo Almeida

398,552 Aufrufe • vor 17 Tagen •via X (Twitter)

5 Kommentare

Profilbild von AI Mastery Guide
AI Mastery Guidevor 16 Tagen

@typesafeai Filling forms by itself is nuts

Profilbild von hello kkit⌘
hello kkit⌘vor 16 Tagen

@typesafeai 能不能在一些saas软件上不断填写表格?

Profilbild von 梭哈.AI
梭哈.AIvor 16 Tagen

@typesafeai 有意思,我试试

Profilbild von hello kkit⌘
hello kkit⌘vor 16 Tagen

@typesafeai 市面上很多人需要在 SaaS 上填表格,月薪 3-5k。这个能实现,直接起飞了。

Profilbild von 晚晚
晚晚vor 16 Tagen

@typesafeai 这速度已经不像填问卷,像在给网页装自动驾驶了

Ähnliche Videos

谁能想到Jev 居然输给了一个 1.88B 本地开源模型🔥 结果真的有点让我意外: 我做了一个贪吃蛇决策游戏 Jev 30:28 险胜,但是换成同一组 68 道决策题,本地模型准确率直接做到 94.1%,Jev 只有 76.5% 一个错了 4 道题,一个错了 16 道题 我本来只是想测试一下 “小模型决策能力怎么?”,结果我抽完发现,小模型虽然小 但是准确率一点也不低。 1️⃣ 先说我是怎么测的 双方使用完全一样的 12×12 棋盘、随机种子、碰撞过滤和路径规划器,只有遇到多个方向都能走的时候,才把选择交给模型。 最后 Jev 吃到 30 个食物,跑满 256 步 本地模型吃到 28 个,在 239 步被困住。 如果单看这一局的成绩,肯定是Jev 赢了。 但是贪吃蛇只是某一步选错以后,后面整条路线都会变,所以我又补了固定的 68 道决策题。 结果 this-that-model-1.0 答对 64/68,94.1%;Jev 是 52/68,76.5%。 Brier Score 也分别是 0.042 vs 0.133,本地模型给出的概率和真实结果更贴近 2️⃣ 这个模型最离谱的地方,是它只有 1.88B this-that-model-1.0 是一个开源的结构化决策模型,MIT License,可以直接在 Mac 本地跑 它和 Jev 的思路其实很像: 不给你写小作文,也不慢慢吐 Token 给它当前状态、一个问题、几个候选答案,它一次前向直接返回: 选哪个 + 每个选项的概率。 所以任务分流、选 Skill、队列选择、标签判断、Agent 下一步动作这种事情,都很适合 我在 M4 上直接用 MPS + FP16 跑,不需要 API Key,也没有网络请求 不同任务中位延迟大概 225~475ms,Snake 实战中位 475ms,平均约 492ms 一个 1.88B 模型,在 Mac 上已经可以做到亚秒级决策。 这个我觉得挺夸张 3️⃣ 我又单独测了 105 道空间决策题 总准确率 84.8%,随机基线只有 34.3% 其中 Snake 状态题、行列文字状态都是 100%,JSON 状态也有 94.4%。 而且输出特别干净。 没有 JSON 少个括号,也不会突然给你解释人生,只会老老实实从候选答案里面选一个,再把概率交给程序 对于 Agent 来说,这种“无聊”反而挺值钱。 4️⃣ 当然它也不是万能的 完整地图测试只有 60.7%,最短路径距离题更是掉到 28.6% 一旦任务需要真正的多步图搜索、连续计算,它就明显不行了 所以这次结果也不能简单理解成: 1.88B 打败 Jev 贪吃蛇单局上是 Jev 赢了,而且 Jev 这次没有保存同条件延迟数据,速度也没法公平比较 真正让我感兴趣的是另一件事: 很多 Agent 里面那些高频、重复、答案明确的小判断,可能根本没必要每次都调用一个大模型,甚至连云端 Jev 都不一定需要。 一个 1.88B、本地运行、一次前向就结束的模型,已经可以完成绝大多数简单的决策了。 一些无关痛痒的简单的决策都可以交给这种小的本地模式、遇到复杂的任务再交给 GPT、Claude这样的大模型可能会更适合。 我现在越来越觉得,未来 Agent 不一定是“所有事情都找最强模型”。 更可能是: 小模型负责做大量的决策,大模型才是真正的为了我们的工作服务。 如果你们感兴趣 也可以部署一下,再偷偷地补充一句 这个可是很牛的牛津团队开源的:

小墨同学

34,654 Aufrufe • vor 15 Tagen

自从马云重新现身后, 蚂蚁集团一直猛冲AI,大动作不断! 像是卯足劲在追赶阿里QWEN! 最近更是连发两款实用拉满的模型!!! 先是百B级的 Ling 2.6 Flash, 盲测阶段就冲上 OpenRouter 趋势榜第一, 直接火到了海外!! 还不算完,Ant Ling 今天又甩出一张底牌: Ling 2.6 1T ! 名字就能看得出来,这个模型能力会更强!! 但有一个误区:能力强的不一定是思考模型! Ling 2.6 1T 不靠拉长推理链条来显得"很聪明", 而是把 token 更多花在理解、规划和输出上。 换句话来说: 它的核心定位,是面向复杂任务,是精准指令下的执行模型!! 1M 超长上下文,能把会议纪要、群聊记录、项目文档、零散资料一次性扔进去统一处理。 强工具调用能力,可以接进 OpenClaw、Hermes、LangGraph、Dify 等跑工作流。 真实问题处理,不只生成漂亮 demo,而是能够读懂已有代码,按照你的要求去干活。 Token 效率更高,不默认展开超长思考,成本控制到最低。 最近一段时间都是免费用,不用白不用, 我拿了几个真实任务跑了一遍,感受超级明显—— 如果是模糊的指令,它可能不太适合。 但如果是比较详细的指令,给它一个工作流, 就完全起飞了!! 没有了推理过程,感觉非常丝滑, 这一点,就挺重要的!! 减少了很多“AI自作聪明”的麻烦!! 说回蚂蚁这两款模型, 完全是冲着落地应用来的,几乎把简单和复杂的应用场景全部包圆。 1T 负责理解复杂目标、拆解任务、整理材料、制定计划。 Flash 负责快速执行、快速改写、快速补全。 这精准切入了现在大多数人用AI的“痒点”: 总想着用一个“最强模型”解决所有的事情。 但我认为真正重要并且正确的是: 让对的模型干对的事。 这样无论是速度、成本、还是结果一致性,都更能符合预期。

沐阳

116,421 Aufrufe • vor 5 Monaten

Jev 居然输给了一个 1.88B 本地模型?我用俄罗斯方块重新测了一遍 当我看到 this-that-model-1.0 在 68 道决策题上做到 94.1% 准确率,而 Jev 是 76.5% 时,我的第一反应是: 这是真的假的? 一个只有 1.88B 参数、可以在 Mac 本地运行的小模型,真的能在决策任务上超过 Jev 吗? 所以我做了一个俄罗斯方块,让两个模型使用相同的棋盘规则、随机种子和方块顺序。程序负责计算所有合法落点,模型只负责决定方块应该放在哪里。 1️⃣ 一开始,Jev 的表现更好 最初,我先过滤掉明显更差的落点,再把剩下的多个候选位置同时交给模型。 在这一模式下,Jev 的表现更加稳定。 我观察到的一轮里: Jev 消除了 5 行,this-that 消除了 3 行。 如果只看到这里,很容易得出结论:本地小模型还是不如 Jev。 但我后来意识到,这种问题可能并不是 this-that 最擅长的形式。 2️⃣ 换成“二选一”后,结果反了 this-that 本质上是一个 typed decision model,更擅长候选明确、边界清楚的选择题。 所以我把决策方式改成了淘汰赛: A 和 B,哪个落点更好? 胜者进入下一轮,继续和其他候选位置比较,直到选出最终落点。 换成这种模式后,我观察到的一轮结果变成了: this-that 消除了 7 行,Jev 只消除了 1 行。 this-that 的棋盘也更加平整,留下的空洞更少。 模型没有变,游戏没有变。 唯一改变的,是我向模型提问的方式。 3️⃣ 这个模型特别在哪里? this-that-model-1.0 只有约 18.8 亿参数,采用 MIT License,可以下载到本地运行。 它不写小作文,也不慢慢生成 Token。 你给它当前状态、一个问题和几个合法选项,它通过一次前向计算直接返回: 选择哪个 + 每个选项的概率 因此它很适合任务分流、Skill 选择、队列判断、风险分级,以及 Agent 下一步动作这类高频决策。 官方模型卡公布的 68 道决策题中,this-that 答对 64 道,准确率 94.1%;Jev 答对 52 道,准确率 76.5%。 在概率校准指标上,this-that 的 Brier Score 是 0.042,Jev 是 0.133。数值越低,代表模型给出的概率与实际结果越接近。 4️⃣ 但这不代表 Jev 被全面打败了 俄罗斯方块是一条连续决策链,前面一个方块放错位置,后面的棋盘状态就会完全不同。单局结果不能代表模型的完整能力。 而且二选一虽然降低了每次判断的难度,却需要进行更多次模型调用,总延迟不一定更低。 所以更准确的结论不是“this-that 全面强于 Jev”,而是: Jev 更适合某些信息丰富的综合比较;this-that 更适合高频、明确、封闭选项的结构化判断。 这次实验真正让我感兴趣的是: 未来的 Agent 可能不应该所有事情都找最强模型。 高频、重复、答案明确的小判断,可以交给本地小模型;真正复杂的推理与生成任务,再交给 GPT、Claude 等大模型。 有时候,决定结果的不只是模型大小。 还包括:你有没有把问题问成它擅长回答的样子。 因为这个模型够小,其实普通电脑也可以部署,大家有需要的可以看下这个开源模型的介绍,链接我放评论区了👇🏻

阿蔺A-Lin

22,001 Aufrufe • vor 14 Tagen

卧槽??一个不到 2B、能本地部署的小模型,给真实 Issue 做分类,跟 JEV 的结果居然这么接近? 最近 JEV 的玩法看了不少,给邮件分类、给 Agent 选工具。这类需求太常见了,我就想知道这张工单该分给谁、下一步该调用哪个工具,真不用每次都给我写一篇分析。 所以这次我把 JEV 和 This That 都接进 Pi,直接拉了 OpenAI Codex 仓库的 30 条真实 Issue,让它们现场做题。 用户是在报 Bug、提功能需求,还是问怎么用?问题出在登录、界面、执行还是会话? 同一份内容、同一组选项,每条做两项判断,两边各发 60 次请求。 跑完一看:JEV 用了 23.5 秒,This That 用了 25.6 秒。30 条里,28 条的两项判断完全一样,两边都没出现请求失败。 速度这轮还是 JEV 快一点。但 This That 只有 18.8 亿参数,权重约 3.76GB,而且能下载到自己机器上跑。这个结果真让我想继续折腾一下了。 它的用法也很干脆:把问题和选项给进去,一次计算直接返回选择和概率。程序拿到结果就能接着往下走,不用再从一大段回答里抠出一个“是”或者“否”。 更实用的是本地部署。客户工单、内部文档、还没发布的产品资料,这些东西只是想分个类,也不一定愿意全部发到外面的 API。 This That 支持 NVIDIA GPU、Apple Silicon 和 CPU,可以把这一步判断留在自己的设备上。做 Agent 的人,手里又多了一个能自己控制的小工具。 这次我跑的是 API 对比,本地性能还没测。28/30 是两个模型判断一致,也不等于准确率,这两个口径先说清楚。 完整录屏放上面。做客服分流、邮件分类、Agent 工具选择的,直接拿一批自己业务里的真实数据试试,比盯着榜单猜有用。 模型和权重: 免费体验地址:

Yanhua

25,209 Aufrufe • vor 14 Tagen

这两年我一直有个默认假设:模型参数越大,能力越强,什么任务都该交给最大的那个模型去做。但最近我在搭一个需要长流程、反复调用工具的 Agent 任务时,专门试了试把"规划"和"执行"拆开、交给不同模型来做的思路,用的执行端模型是Ant Ling刚发布的 Ling-3.0-flash。这次体验让我对"大模型不是越大越好"这句话有了更具体的理解。 我遇到的问题 起因是我想搭一个 Blender MCP 的工作流:让 AI 帮我自动完成一个简单场景的粗模搭建和运镜——比如摆几把椅子、设置一个摄像机轨迹,作为后续正式渲染前的预演草稿。 一开始我图省事,直接让一个参数量很大的全能模型来处理整个流程:既要它想清楚场景该怎么布局、镜头该怎么运动,又要它高频地调用 Blender 的 MCP 接口去逐步执行动作。 结果是,虽然效果还行,但每一步操作等待的时间都不短,跑完一整套流程花的时间和成本都超出了我的预期——毕竟这类任务里,真正需要"深度思考"的部分只占很小一块,绝大多数时间都花在了"调用接口、摆放物体"这类重复动作上。 换成"规划-执行分离"之后 我把流程拆成了两段:先用一个知识面更广的大模型,把场景的整体构图、镜头运动路径想清楚,写成一份结构化的操作说明;然后把这份说明交给 Ling-3.0-flash,让它作为执行引擎,逐条读取说明并调用 Blender MCP 接口去落地。 这一次的差别很明显。Ling-3.0-flash 的总参数量是 124B,但实际推理时只激活 5.1B 参数,加上首字延迟能做到 500 毫秒以内,我能感觉到每一步操作的响应几乎是"秒回"的——不再是那种等大模型"想"完再动手的节奏,而是我一条指令下去,场景里的物体几乎立刻就摆好了。整套流程跑下来,成本也比全用大模型的方案低了不少。 我的体会 这次尝试让我确认了一件事:如果任务里"想清楚该怎么做"和"把已经想清楚的事情执行出来"这两部分能拆开,那把执行这一段交给 Ling-3.0-flash 这类专门优化过工具调用稳定性和响应速度的模型,确实比一个模型包办到底更划算。 但我也发现,这套分工不是无脑套用的——如果场景本身很复杂,需要边搭建边做美学判断(比如构图是否好看、光影是否协调),单靠 Ling-3.0-flash 自己去决定,效果就会打折扣,这部分还是得靠前期规划阶段先想清楚。 人负责把边界和验收标准定好,大模型负责规划,Ling-3.0-flash 负责又快又稳地把方案落地——这套组合让我第一次比较直观地感受到"规划-执行分离"这套架构的实际好处。 目前Ling-3.0-flash 现已在 OpenRouter 上线——并可免费使用至 2026 年 8 月 3 日。 链接: 也可以直接网页对话体验: 大家不妨去体验体验一下,感受下魅力

韭菜饼子

83,352 Aufrufe • vor 2 Monaten

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,630 Aufrufe • vor 6 Monaten

想认真做小红书个人号或者矩阵的朋友,这个 Skill 真的能帮你省掉 80% 的重复劳动。 看了我的 AI 工作流分享以后,很多宝子问有没有小红书自动化运营的工具,我GitHub上找了下,这个还不错, 说实话,我之前也以为所有小红书自动化工具都是垃圾, 要么用两天就封号,要么复杂到要写几百行代码,要么就是个只能发文字的残废,直到我试了这个, 最牛逼的是它的安全机制:完全不用小红书 API,全程用浏览器自动化模拟真人点击和输入。 第一次扫码登录后,后续所有操作都和你自己手动点一模一样,目前是我见过封号风险最低的方案。 而且它真的零代码,你不需要懂任何编程,只要对着 你的龙虾或者 hermes 说一句话就行: • 帮我分析一下我的首页推荐流 • 帮我生成五个今天能发的选题 • 帮我复刻这篇爆款笔记 • 帮我回复一下最新的评论 它全都能自己干完, 最狠的是它不只是一个单纯的发稿工具,它还有一个完整的运营闭环: 会分析你的账号数据、拆解别人爆款的结构、生成内容+封面、自动发布、自动回评, 还会把所有分析结果和操作自动存成 Markdown 知识库,方便你后续复盘。 安装也简单到离谱: 打开 Openclaw,直接说 “帮我安装这个 skill 就完事了。 仓库地址老规矩评论区自取鸭🦆

AYi

24,613 Aufrufe • vor 4 Monaten

真正言出法随的AI视频工具,终于被我找到了!! 而且还是个100%开源的视频世界模型项目! 这个用来做视频真的很高级! 先说一个长期的“痒点”,做AI视频为了保证空间场景的一致性, 不得不生成一大堆各种角度的场景的图片作参考约束, 要确保正反打都不会穿帮,要确保镜头转过去再转回来场景不走形, 但其实,这个方法很原始! 但如果,直接可以生成一个高度一致性的空间, 让人物站在该有的位置,并且还能够自由控制镜头在空间里的运动, 所有一致性的困扰,就全部解决了!! AlayaWorld Alaya Lab 就完全是这个思路, 根据任何图片和视频,实时渲染一个自由空间, 先固化一个场景,然后人物和道具进场,先搭景再拍摄, 这样做视频的体验,就无限接近于真实片场! 你就像一个导演,站在片场里,并且拥有“言出法随”的能力! 改天气、换演员、换服装、甚至直接换场景,可玩性和可控性全部拉满, 突发奇想的指令或者是已经设置好“技能”,就可以实时渲染出来! 而且这个时长不受限制,一个空间里,“拍摄”多久都可以。 想想就很爽,这种创作体验,是前所未有的!! 不光是视频,这也完全是彻底改变游戏行业的存在。 尤其是那种沉浸感很强的第一人称游戏! 越说越激动,这个项目现在是完全开源的, 有兴趣的朋友,真的可以关注一下这方面的趋势, 我觉得在这个探索世界模型的阶段, 这个,就是最好的落地应用!!

沐阳

31,236 Aufrufe • vor 2 Monaten