Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

Jev 太有意思了, 我把 Jev 接入 Claude Code、Codex 了…… 我直接让 Codex + Jev 帮我判断下:Mac mini 我到底要不要买? 结果 Jev 回答很果断:不买!!😂 这玩意儿拿来做判断是真有点意思,关键是速度快、还巨省钱!! 以后做选择、判断这种杂活就交给 Jev 吧,Claude Code、Codex 干活,Jev 下结论。 这组合我感觉还能继续玩出不少东西……

120,846 Aufrufe • vor 17 Tagen •via X (Twitter)

7 Kommentare

Profilbild von cambridgeheg11@gmail.com
[email protected]vor 16 Tagen

你在问他下是不是真调用了typesafe。应该会回答你不是😂

Profilbild von 倪塍
倪塍vor 16 Tagen

倒不如说这是一种趋势,以后就是多个ai模型一起完成一个项目

Profilbild von 麦麦Maylia
麦麦Mayliavor 16 Tagen

能不能问一问科技还要沉溺多久?

Profilbild von Gate高返85小简
Gate高返85小简vor 17 Tagen

把决策权外包给AI是种新潮流

Profilbild von chance
chancevor 16 Tagen

Codex 干活、Jev 拍板——这分工比再堆一个全能 agent 实在。Mac mini 那种二元选择,本来就不该烧思考额度;省钱是副产品,路由对了才是主收益。

Profilbild von Wei佳
Wei佳vor 16 Tagen

问一问他,你之前买的两部iPhone能不能赚钱?😁

Profilbild von 小码哥
小码哥vor 16 Tagen

我已经退了……

Ähnliche Videos

卧槽??一个不到 2B、能本地部署的小模型,给真实 Issue 做分类,跟 JEV 的结果居然这么接近? 最近 JEV 的玩法看了不少,给邮件分类、给 Agent 选工具。这类需求太常见了,我就想知道这张工单该分给谁、下一步该调用哪个工具,真不用每次都给我写一篇分析。 所以这次我把 JEV 和 This That 都接进 Pi,直接拉了 OpenAI Codex 仓库的 30 条真实 Issue,让它们现场做题。 用户是在报 Bug、提功能需求,还是问怎么用?问题出在登录、界面、执行还是会话? 同一份内容、同一组选项,每条做两项判断,两边各发 60 次请求。 跑完一看:JEV 用了 23.5 秒,This That 用了 25.6 秒。30 条里,28 条的两项判断完全一样,两边都没出现请求失败。 速度这轮还是 JEV 快一点。但 This That 只有 18.8 亿参数,权重约 3.76GB,而且能下载到自己机器上跑。这个结果真让我想继续折腾一下了。 它的用法也很干脆:把问题和选项给进去,一次计算直接返回选择和概率。程序拿到结果就能接着往下走,不用再从一大段回答里抠出一个“是”或者“否”。 更实用的是本地部署。客户工单、内部文档、还没发布的产品资料,这些东西只是想分个类,也不一定愿意全部发到外面的 API。 This That 支持 NVIDIA GPU、Apple Silicon 和 CPU,可以把这一步判断留在自己的设备上。做 Agent 的人,手里又多了一个能自己控制的小工具。 这次我跑的是 API 对比,本地性能还没测。28/30 是两个模型判断一致,也不等于准确率,这两个口径先说清楚。 完整录屏放上面。做客服分流、邮件分类、Agent 工具选择的,直接拿一批自己业务里的真实数据试试,比盯着榜单猜有用。 模型和权重: 免费体验地址:

Yanhua

25,209 Aufrufe • vor 15 Tagen

Jev 居然输给了一个 1.88B 本地模型?我用俄罗斯方块重新测了一遍 当我看到 this-that-model-1.0 在 68 道决策题上做到 94.1% 准确率,而 Jev 是 76.5% 时,我的第一反应是: 这是真的假的? 一个只有 1.88B 参数、可以在 Mac 本地运行的小模型,真的能在决策任务上超过 Jev 吗? 所以我做了一个俄罗斯方块,让两个模型使用相同的棋盘规则、随机种子和方块顺序。程序负责计算所有合法落点,模型只负责决定方块应该放在哪里。 1️⃣ 一开始,Jev 的表现更好 最初,我先过滤掉明显更差的落点,再把剩下的多个候选位置同时交给模型。 在这一模式下,Jev 的表现更加稳定。 我观察到的一轮里: Jev 消除了 5 行,this-that 消除了 3 行。 如果只看到这里,很容易得出结论:本地小模型还是不如 Jev。 但我后来意识到,这种问题可能并不是 this-that 最擅长的形式。 2️⃣ 换成“二选一”后,结果反了 this-that 本质上是一个 typed decision model,更擅长候选明确、边界清楚的选择题。 所以我把决策方式改成了淘汰赛: A 和 B,哪个落点更好? 胜者进入下一轮,继续和其他候选位置比较,直到选出最终落点。 换成这种模式后,我观察到的一轮结果变成了: this-that 消除了 7 行,Jev 只消除了 1 行。 this-that 的棋盘也更加平整,留下的空洞更少。 模型没有变,游戏没有变。 唯一改变的,是我向模型提问的方式。 3️⃣ 这个模型特别在哪里? this-that-model-1.0 只有约 18.8 亿参数,采用 MIT License,可以下载到本地运行。 它不写小作文,也不慢慢生成 Token。 你给它当前状态、一个问题和几个合法选项,它通过一次前向计算直接返回: 选择哪个 + 每个选项的概率 因此它很适合任务分流、Skill 选择、队列判断、风险分级,以及 Agent 下一步动作这类高频决策。 官方模型卡公布的 68 道决策题中,this-that 答对 64 道,准确率 94.1%;Jev 答对 52 道,准确率 76.5%。 在概率校准指标上,this-that 的 Brier Score 是 0.042,Jev 是 0.133。数值越低,代表模型给出的概率与实际结果越接近。 4️⃣ 但这不代表 Jev 被全面打败了 俄罗斯方块是一条连续决策链,前面一个方块放错位置,后面的棋盘状态就会完全不同。单局结果不能代表模型的完整能力。 而且二选一虽然降低了每次判断的难度,却需要进行更多次模型调用,总延迟不一定更低。 所以更准确的结论不是“this-that 全面强于 Jev”,而是: Jev 更适合某些信息丰富的综合比较;this-that 更适合高频、明确、封闭选项的结构化判断。 这次实验真正让我感兴趣的是: 未来的 Agent 可能不应该所有事情都找最强模型。 高频、重复、答案明确的小判断,可以交给本地小模型;真正复杂的推理与生成任务,再交给 GPT、Claude 等大模型。 有时候,决定结果的不只是模型大小。 还包括:你有没有把问题问成它擅长回答的样子。 因为这个模型够小,其实普通电脑也可以部署,大家有需要的可以看下这个开源模型的介绍,链接我放评论区了👇🏻

阿蔺A-Lin

22,001 Aufrufe • vor 15 Tagen

这两天关于 Jev 这个模型的热度非常之高,甚至可以说是近半年我重点关注了英推以来,看到的原创内容密度最高的一次。 正好我过去一年一直在跑一个小项目,其中有一个环节就是要对每天出版的《人民日报》上的新闻做一个分类,判断每一篇文章中是否包含有湖北相关的元素。 一年跑下来,积累了接近 2 万 4 千条数据,其中判定包含的有 1800 条左右。在这些数据的基础上,我随机筛选了一个测试数据集,其中包含了 500 条判定包含的内容,以及 500 条判定不包含的内容。 之前我使用的模型一直是 Gemini 的 Flash Lite 系列,也算是经过测试后成本和速度双重考虑下的最佳选择。 今天 OpenRouter 上线了这个 Jev 之后,我用同样的提示词做了一个小 Demo 做了一下对比测试,下面这个视频就是同时并发 16 个进程的实录效果。 不得不说,测试出来的结果超出预期很让人惊喜啊。 首先,速度是真快!相对于 Gemini Flash Lite 单篇文章 3 秒的平均耗时,Jev 把单篇耗时缩减到了 0.35 秒。这个接近 10 倍的速度提升,真的是实现了质的飞跃,带了很多新场景的想象空间。 其次,质量也真不错!和 Gemini Flash Lite 的分类结果相比对,Jev 大概在 15% 左右的内容上出现了判断不一致的情况。 但经过我的手动审核,大部分都是因为人名而导致判断差异。例如某位此前在湖北省任职过的官员姓名出现在了新闻中时,Flash Lite 因为知识库比较大,会将其判断为包含,而 Jev 在这块上面会弱一点,因此判定为了不包含。在我的实际应用场景中,这种判断差异完全可以接受。 最后,价格也是真便宜啊!看了一下 OpenRouter 的账单,前前后后大概跑了 5 千条数据,30M Token,总共开销也就 1 美元!这个性价比,还要什么自行车! 总之,我个人觉得 Jev 代表的分类器大模型的确是一个非常有前景的发展方向,甚至可以说是在分类场景下实现了速度/质量/价格的不可能三角,有类似需求的朋友真的可以好好考虑一下。 就分享到这了,我得连夜用它去优化生产项目了。

李不凯正在研究

18,658 Aufrufe • vor 19 Tagen

谁能想到Jev 居然输给了一个 1.88B 本地开源模型🔥 结果真的有点让我意外: 我做了一个贪吃蛇决策游戏 Jev 30:28 险胜,但是换成同一组 68 道决策题,本地模型准确率直接做到 94.1%,Jev 只有 76.5% 一个错了 4 道题,一个错了 16 道题 我本来只是想测试一下 “小模型决策能力怎么?”,结果我抽完发现,小模型虽然小 但是准确率一点也不低。 1️⃣ 先说我是怎么测的 双方使用完全一样的 12×12 棋盘、随机种子、碰撞过滤和路径规划器,只有遇到多个方向都能走的时候,才把选择交给模型。 最后 Jev 吃到 30 个食物,跑满 256 步 本地模型吃到 28 个,在 239 步被困住。 如果单看这一局的成绩,肯定是Jev 赢了。 但是贪吃蛇只是某一步选错以后,后面整条路线都会变,所以我又补了固定的 68 道决策题。 结果 this-that-model-1.0 答对 64/68,94.1%;Jev 是 52/68,76.5%。 Brier Score 也分别是 0.042 vs 0.133,本地模型给出的概率和真实结果更贴近 2️⃣ 这个模型最离谱的地方,是它只有 1.88B this-that-model-1.0 是一个开源的结构化决策模型,MIT License,可以直接在 Mac 本地跑 它和 Jev 的思路其实很像: 不给你写小作文,也不慢慢吐 Token 给它当前状态、一个问题、几个候选答案,它一次前向直接返回: 选哪个 + 每个选项的概率。 所以任务分流、选 Skill、队列选择、标签判断、Agent 下一步动作这种事情,都很适合 我在 M4 上直接用 MPS + FP16 跑,不需要 API Key,也没有网络请求 不同任务中位延迟大概 225~475ms,Snake 实战中位 475ms,平均约 492ms 一个 1.88B 模型,在 Mac 上已经可以做到亚秒级决策。 这个我觉得挺夸张 3️⃣ 我又单独测了 105 道空间决策题 总准确率 84.8%,随机基线只有 34.3% 其中 Snake 状态题、行列文字状态都是 100%,JSON 状态也有 94.4%。 而且输出特别干净。 没有 JSON 少个括号,也不会突然给你解释人生,只会老老实实从候选答案里面选一个,再把概率交给程序 对于 Agent 来说,这种“无聊”反而挺值钱。 4️⃣ 当然它也不是万能的 完整地图测试只有 60.7%,最短路径距离题更是掉到 28.6% 一旦任务需要真正的多步图搜索、连续计算,它就明显不行了 所以这次结果也不能简单理解成: 1.88B 打败 Jev 贪吃蛇单局上是 Jev 赢了,而且 Jev 这次没有保存同条件延迟数据,速度也没法公平比较 真正让我感兴趣的是另一件事: 很多 Agent 里面那些高频、重复、答案明确的小判断,可能根本没必要每次都调用一个大模型,甚至连云端 Jev 都不一定需要。 一个 1.88B、本地运行、一次前向就结束的模型,已经可以完成绝大多数简单的决策了。 一些无关痛痒的简单的决策都可以交给这种小的本地模式、遇到复杂的任务再交给 GPT、Claude这样的大模型可能会更适合。 我现在越来越觉得,未来 Agent 不一定是“所有事情都找最强模型”。 更可能是: 小模型负责做大量的决策,大模型才是真正的为了我们的工作服务。 如果你们感兴趣 也可以部署一下,再偷偷地补充一句 这个可是很牛的牛津团队开源的:

小墨同学

34,654 Aufrufe • vor 16 Tagen