Video yükleniyor...
Video Yüklenemedi
用Deepseek V4 Pro 0813跑了三个简单任务。 1. 第一个是开发部署一个网站,需要调用3个Skill,完成网站开发,子域名解析和上线。 2. 第二个是模仿60种设计风格,生成Bento卡片图展示。 3. 第三个是Threejs 生成一个3D打砖块游戏。 大家可以看看效果,我感觉还行。
68,677 görüntüleme • 1 ay önce •via X (Twitter)
23 Yorum

说白了三个任务全是 demo 级,deploy 一个站、生成卡片、打砖块,教程照抄就能跑 所有花哨评测都死在好看没深度这层,就像外卖摆盘好看一口下去全是预制菜 真测 V4 Pro 得丢个跨文件 bug 让它追,或者重构一个跑了两年没文档的 legacy repo 感觉还行 可能就是最诚实的评价了

这三个任务其实在测三种不同的东西:第一个测工具调用链路,第二个测长上下文里的风格保真,第三个测一次成型的代码能力。 真要判断能不能拿去接活,我只盯第一个——调 3 个 Skill 完成开发、解析、上线,中间任何一步掉链子,交付就得人工补,省下的模型钱全赔进去。 后两个再好看也是 demo 级,客户不会为鹈鹕和 Bento 卡付钱。

我用的opencode的套餐,flash和pro出来的砖块游戏都没法玩,一个是移动速度极其慢,一个是球反方向飞,点击开始就失败

明天再测比较好,我觉得今天应该还有问题

现在 AI 圈对“简单任务”的定义已经膨胀了: 开发并上线一个网站,复刻60种设计风格,再做个3D游戏。 放在以前,这叫三个项目;放在今天,只能算模型热身。下一步建议测试真正的困难任务:让它把产品做完以后,顺便找来第一个付费用户。

感觉还行已经不错了,尤其是涉及部署和3D交互这种容易出错的环节,能稳定输出可运行结果,说明工程化能力在提升。

调用那三个skill 部署网站

测知识库截止日期了吗?总感觉没有型号区别没安全感呢。

新的斬殺線

模仿60种设计风格这条最有看点,Bento 卡片最吃对栅格、留白和配色的理解,能批量稳定输出说明模型对设计规范有内化。3D 打砖块也顺带验证了代码生成,0813 这版工程能力确实能打。

Dont use CC witj DS

测这种简单前端没有任何意义

怎么不是经典鹈鹕骑车

试了单网页生成还不如一年前的,CSS 乱糟糟的

V4pro有多模态了吗?

有支援視覺嗎?

沒有視覺之下打磚塊看上去還挺不錯

这哪是“还行”啊 这是把产品经理、前端、运维、美术一起按进榨汁机了哈 打工人看完沉默三秒开始装忙

三个任务一把梭,这效率可以啊,打砖块游戏有链接吗想玩。

没错,这种简单前端意义不大,目前看来水平不高,不如grok更新惊艳

我时间久了都忘了,配的时候模型直接是 v4 pro 就行吧?需要写后面的 0813 吗? 应该不用吧?现在调用的都 是正式版 吧?

不需要加日期 Pro就行

嗯。我记的好像也是不用。。谢谢乔木解答。
