Loading video...
Video Failed to Load
这两天关于 Jev 这个模型的热度非常之高,甚至可以说是近半年我重点关注了英推以来,看到的原创内容密度最高的一次。 正好我过去一年一直在跑一个小项目,其中有一个环节就是要对每天出版的《人民日报》上的新闻做一个分类,判断每一篇文章中是否包含有湖北相关的元素。 一年跑下来,积累了接近 2 万 4 千条数据,其中判定包含的有 1800 条左右。在这些数据的基础上,我随机筛选了一个测试数据集,其中包含了 500 条判定包含的内容,以及 500 条判定不包含的内容。 之前我使用的模型一直是 Gemini 的 Flash Lite 系列,也算是经过测试后成本和速度双重考虑下的最佳选择。 今天 OpenRouter 上线了这个 Jev 之后,我用同样的提示词做了一个小 Demo 做了一下对比测试,下面这个视频就是同时并发 16 个进程的实录效果。 不得不说,测试出来的结果超出预期很让人惊喜啊。 首先,速度是真快!相对于 Gemini Flash Lite 单篇文章 3 秒的平均耗时,Jev 把单篇耗时缩减到了 0.35 秒。这个接近 10 倍的速度提升,真的是实现了质的飞跃,带了很多新场景的想象空间。 其次,质量也真不错!和 Gemini Flash Lite 的分类结果相比对,Jev 大概在... show more
18,658 views • 20 days ago •via X (Twitter)
31 Comments

不是,这种任务典型的能力错配,让 Gemini 几分钟给你写一个朴素贝叶斯模型,处理一千篇文章的分类都根本用不上一秒,准确和召回都能高得多

的确是想过这么干,但判断是否涉及湖北的因子是否太多了?等我晚点让 AI 写个对比一下看看

感觉贝叶斯方法在这种需要穷尽关键词的应用场景中效果没有那么好

这速度看着很爽啊

非常爽,赏心悦目

你用Gemini境外模型做湖北政府的项目,这个不是数据出境了吗? 你们也是接的外包项目么,之前Claude的类似案例估计就是这种😁

首先,不是政府项目,是我个人的小项目,其次,用的是人民日报的公开信息,不涉及任何秘密和隐私,最后,国模型真干不了这活,浑身敏感词啊

嗯,那就好,别到时干个外包活,上面查下来,你被撸了。 我听你说在人民日报找涉及湖北的信息,以为是湖北政府的外包项目。

@libukai 然后过几天google又发布了个AI人权报告,说我们利用美国豆包做政府项目外包哈哈哈

@BarrettDream 哈哈哈,能有免费广告也行啊

挺有意思,15% 的偏差是可接受的 还是可以人来兜底?

算是可以接受吧,后面还有 AI 的二次判断

一年两万条做湖北相关分类,小判别模型其实挺合适。大模型那边你有没有对过召回和误报,单条成本大概差几倍?

感觉适合信息初筛

对,重点在于“初”这个词

两万条湖北相关的样本,这数据量够训个小分类器了吧

高密度原创才是核心,好项目码住!

我想了解一下,就是那 15% 的不一致的情况,有没有可能优化prompt 来去提升准确率

有优化空间的,这个 Prompt 我改过很多遍,原则上是尽可能放宽了标准的,因为后面还有一道 AI 和一道人工,只需要做初筛就行了

这个不错…

对中文内容判断能做到这个程度也真是超出预期了

85% F1 比较勉强,微调一下qwen 4B模型,跑到95%以上没啥问题🤔 训练成本几百美金

这个实际正确率应该在 95% 了,15%只是差异率。至于训练模型,我真不会啊……

我也不会,claude都会🤣

听劝去对比测试贝叶斯分类器去了,还是有自己的测试集爽啊,想干啥干啥

这个比较适合做舆情监测项目吧?

感觉挺适合的,量越大实时性要求越高越适合,例如实时的弹幕审核

jev刚上线就这么多人在关注,有那么厉害吗?我梳理了一下,确实还挺好玩的。

这个能炒股吗😃

这么快的速度,应该很快就能爆仓吧

写得很详细,受教。我也去注册个,很多场景都 用到。
