Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是...

30,709 görüntüleme • 1 yıl önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

最近国内几个模型大厂好像摊上事了? 也不知道真事假事,还是那个姓A的在碰瓷挑事! 吃瓜的时候,突然刷到一个新模型! 乍一看Atria ASI,差点看成了是Astra,真的很像, 模型代号叫 Atria Dawn Preview! 据说背后约三分之二的研发成员还是高校在校学生!! 我是真想知道这群学生能把模型做成什么样? 所以,找了很久才找到了API,接入下来测试了一下, 我用它一句话做个 3D 家装工作台,最后出来的效果居然还可以!! 能画户型、拖家具、改尺寸、保存项目、导出截图、还能自由拖放布置家具, 其实这个任务倒是不难,主要我一句话说的很笼统, 需要它能够理解我的意图,并且准确规划,将这个工作台做的尽可能完善。 但其实,写代码还并不是这个模型的主要能力。 它的定位,是面向科研和专业工作的智能体模型,擅长把一个复杂任务继续往前推进,最终变成可运行、可检查、可使用的成果。 比如从一个问题、一份数据、一段代码或者一篇论文出发,它可以继续完成资料检索、代码实现、实验执行和反馈修正,最后交付研究报告、软件系统、文档表格、演示文稿、三维设计等等。 可以用来做科研、写报告、写代码、画CAD!! 不知道这个API能用多久,后面我可以再测试一下不同的场景。 有兴趣可以持续关注一下!

沐阳

37,855 görüntüleme • 26 gün önce