
karminski-牙医
@karminski3 • 39,229 subscribers
A coder, road bike rider, server fortune teller, electronic waste collector, co-founder of KCORES, ex-director at IllaSoft, KingsoftOffice, Juejin.
Shorts
Videos

终于搞完了! 给大家带来小模型竞技场, 这次测试了8款模型, 包括: Qwen3.8-27B Qwen3.6-27B Qwen3.6-35B-A3B Ornith-1.5-35B-A3B Gemma-4-31B Gemma-4-26B-A4B Gemma-4-12B GPT-OSS-20B 每个模型4个量化版本, 还测试了 MTP 开启和关闭, 以及 low, medium, xhigh 三档思考强度, 做了个全面横评. 测试主要集中在前端, python, Agent 能力上, 每个测试运行3次取最佳结果(pass@3). 测试使用H100显卡(注意用H100是为了生成快, 就这还跑了48小时, 显卡不影响生成效果, 只影响生成速度), 总成本148刀. 那么这些模型中究竟谁是开源之神? 请看视频! #qwen38 #qwen3827b #qwen26 #gemma4 #ornith #阿里千问
karminski-牙医56,785 views • 2 days ago

给大家带来刚刚发布的 DeepSeek-V4-Flash-Vision-Exp 和 openrouter 上的匿名模型 OX-Alpha 多模态实测! 这次是刚要测V4-Flash-Vision的时候评论区有老铁说 OX-Alpha 特别猛, 于是就一起带上了. 使用的是我写的AI电竞教练框架, 由于ds的多模态不支持视频输入, 所以公平起见两个模型都用视频抽帧的方式进行测试, 主要看他们使用Agent, 能否精准识别CS2的游戏录像, 分析玩家的优势和不足, 并提出改进意见. 除此之外, 我还进行了详细测试, 给到大家这两个模型的最佳输入图片配比, 请看视频! #oxalpha #deepseekv4flashvision #多模态大模型 #deepseek #deepseek多模态
karminski-牙医23,125 views • 10 days ago

就这??? 马斯克你认真的吗? 来看 Grok4 实测! 我原本打算用新试题, 突然转念一想, 万一Grok4 延续了 Grok3 的辉煌传统怎么办? 于是直接用了经典到都出包浆的我的那个20小球在七边形里面弹跳的实体快速来了一遍. 结果, 3次生成代码中, 2次 Grok4生成的代码甚至有语法错误. 唯一一次成功的是这个样子. 为了给不了解这个测试的朋友做对比, 我放了 DeepSeek-R1 作为参考, 注意哦,这个甚至不是 DeepSeek-R1-0528, 而是今年年初的那个老版本 R1.... 从目测来看, 大概是今年第一季度所有大模型中, 写代码能力的中间水平, 接近GPT-4o 或 kimi-1.5-long-thinking 之间. 根本不是第一梯队的水平, 更别提跟现在的 Claude-4 或者 Gemini-2.5-pro 比了..... 建议 AIME25 那个数学能力也谨慎看待, 说不定又是一个过拟合的结果. 更多测试我随后放出, 希望 Grok4 能打我的脸. 但这编程水平....呵呵. #Grok4
karminski-牙医612,825 views • 1 year ago

完了! 我的整活被官方相中了! 搞了个AI电竞教练的 Harness Agent 框架, 拖进去 CS2 录屏视频后就能分析走位, 身法, 对枪, 预瞄, 投掷物, 经济, 等各种数据, 然后还能给出建议和训练方向. 结果被字节跳动相中了, 于是结合 Doubao-Seed-2.0-Lite 整了个大活, 连续运行25小时不间断分析对局视频总结玩家的帝王干拉是否到位(x 这次 Doubao-Seed-2.0-Lite 的宣发 Demo 视频那个AI电竞教练的就是这个 Demo 哈. 以及, 具体的整活视频还在制作中~ 大家稍安勿躁, 稍后给大家带来全部整活细节~ #seed20lite #doubao #doubaoseed #字节跳动
karminski-牙医158,825 views • 3 months ago

再给 Grok 4 一次机会哈 上个20小球测试有朋友说一个case不能代表什么, 我就问一句, 如果你写代码, 上来的第一个 case 就拉跨, 你还会再用这个模型吗? 两个 case 也拉跨呢? 汰欧蜜!撸可英买埃斯! 这个是上个月我做出来的拆烟囱测试, 主要是使用 Three.js 来模拟一个三维场景, 尤其是这个烟囱完全需要大模型生成代码自己搭起来. 然后在烟囱底部设置爆炸点, 炸掉一部分砖块后, 影响烟囱的平衡导致烟囱倒塌。 这个测试相对于20小球七边形测试来说, 考察物理效果其实没有 20 小球复杂, 它只有碰撞和重力, 并且都能依靠 Three.js 库的插件来实现. 所以考察项目更多聚焦于 prompt 的指令遵循和前端代码的能力以及创造性. 直接来看 Grok4 表现好的和不好的地方。 好的: 倒塌的模拟不错, 模型的放置, 重力方向起码没有搞错 不好的: 默认的烟囱就是个已经爆炸到一半的烟囱是绷不住了,这个连上个月测试的 kimi 和 minimax 的开源模型都不至于这么抽象 爆炸的粒子模拟很怪,勉强能理解那个白色的是一团烟雾 光影效果特别差,对比左边的 DeepSeek 一眼就能看出来了 web 交互写得也很差, 看 DeepSeek 的按钮, 这个的按钮就是个灰色的按钮 (在画面外) 以及最重要的, 它生成其实是失败的!我反复测试3次都有代码错误。它引用库的方法有问题 (Uncaught TypeError: Failed to resolve module specifier "three". Relative references must start with either "/", "./", or "../".),并且它自己修不好这个报错。我只能用 Claude-4-Sonnet 修了一下才能正确运行........ 结论:别用这玩意写代码, 爱咋咋地吧, 累了 #Grok4
karminski-牙医162,836 views • 1 year ago

俺上电视啦! 聊聊 kimi-k3 这么猛为什么还要开源 上周有幸接受了深圳卫视-科创最前沿栏目的采访, 主要聊了聊 Kimi-K3 这次取得如此牛的成绩背后的意义. 以及SOTA级别的模型就这样开放权重了, 不怕别人抄吗? 在我来看是真不怕的, 想象一下一个武林高手, 把自己的秘籍写成书, 免费送. 那是不是就意味着这些武林秘籍不是谁都练的. 大模型的情况也是这样的, 虽然权重也开源了, 训练技术也开源了, 但是, 最重要的, 训练使用的数据和经验, 这个是没开源的. 举个最典型的例子, 现在个人拿到kimi-k3的模型权重, 然后自己租算力微调, 大概率是会把模型越调越拉跨的. 就是因为既没有优质的后训练数据, 也没有优秀的后训练能力. 而现在大模型训练的数据其实大部分都是AI合成的了. 护城河已经从“静态的代码和模型权重”转移到了“持续的进化能力和数据飞轮”了. 所以即使全面复刻了 kimi-k3 的技术架构, 但是没有高质量合成数据流和持续的后训练体系, 也是没有办法竞争的. 但是 kimi-k3 开源获得的收益却是事实存在的, 不但能获得超高的曝光, 而且还能提升自己的社区影响力, 并且还能收获社区的正向反馈. 开源出来的训练工具链, 社区优秀的工程师在使用中也会不断的帮助反馈和提升. 形成整个生态的进步. 得道者多助这个道理是不会变的. #kimik3 #深圳卫视 #科创最前沿
karminski-牙医17,354 views • 29 days ago

游戏代打也要失业了? 来看 NVIDIA NitroGen NVIDIA 刚刚又发了个新模型 NitroGen,这是个只有 1B 大小却可以玩游戏的大模型,它接受视频帧输入,然后输出手柄操作。所以非常适合用来玩手柄可以操作的动作类游戏。 这个模型最大的特点是,它是基于游戏视频本身学习的,以往互联网上虽然有很多游戏视频,但是游戏操作并没有记录下来,而 NitroGen 它利用了合成动作标签技术。研究团队通过大规模的逆动力学模型,从公开的互联网游戏视频中“反推”出当时玩家可能按下的键,从而人工合成了海量的训练数据,通过上万小时的纯视频数据进行预训练,打破了数据瓶颈。 而且最重要的是,这个模型支持后训练。这意味着面对一款它从未见过的全新游戏不需要从头训练,只需少量的微调或适配即可上手游玩。
karminski-牙医103,479 views • 8 months ago

给大家带来 DeepSeek-V4-Pro & Flash 的测试速报, 由于case 还在跑, 所以说一下大家最熟悉的大象牙膏测试. 这个测试要求大模型建模一个锥形瓶, 然后发生化学反应, 造成泡沫喷发而出的效果. 主要考验大模型的建模, 粒子, 物理模拟, 光照等广义上的前端能力. DeepSeek-V4 从这个 Case 来看比之前的 V3 整个系列都好了很多, 效果很不错, 不过大家注意一下细节, 这个锥形瓶的表面看上去不是很透明, 我仔细分析了6次生成的代码 (测试是 pass@6, 每个大模型都有6次生成机会, 取最好的一次). 结果发现它指令遵循有点问题, 提示词要求玻璃的材质是roughness: 0.95, metalness: 0.35, 结果它没有一次写对. 而且很值执拗的写成了roughness: 0.12, metalness: 0.05 (50%概率). 目前还不确定是不是普遍问题, 等我全部测完给大家带来全面的编程能力评测视频~ 敬请期待. #deepseek #deepseekv4 #deepseekv4pro #deepseekv4flash
karminski-牙医47,337 views • 4 months ago

ADOBE 真的在努力不被AI淘汰,我哭死 Illustrator 现在支持旋转画面了,不是传统的那个"旋转", 看视频就知道了.
karminski-牙医110,640 views • 1 year ago

Anime.js 刚发了个大版本,官网demo是真的炫酷,没错,你在这个视频看到的全都是用anime.js 这个库实现的动画 地址:
karminski-牙医121,258 views • 1 year ago

Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏! 给大家带来刚刚正式发布的 kimi-k2.6 的正式版本的实测! 本次为了考验它的长程Agentic Coding能力, 我用 kimi-k2.6-code-preview 写了个 harness 游戏自动生成框架, 它可以根据给到的人设/场景/数值设计等规则, 自动生成关卡, 背景图片, 甚至配音! 其中框架驱动和草稿模型使用 kimi-k2.6, 文生图和生成语音由 kimi-k2.6 生成 prompt 后调用其它大模型生成. 最好玩的是, 我做了个"无头"版本的游戏cli接口, kimi-k2.6 能像玩互联网早期Mud游戏一样, 使用纯文本玩这个游戏, 每当它生成关卡之后, 他就可以直接进入游戏游玩一下, 来验证关卡设计得是否正确. 而内部设计又分为了对话生成skill, 脚本生成skill, 关卡生成skill, 游戏测试大师skill, 游戏资深玩家skill(由于检讨游戏性) 等等, 从而实现了让大模型自己写游戏自己玩! 每个关卡大概需要一个小时生成和验证, 如果并行验证应该还能更快一些(做多线程BFS/DFS). 另外本次依旧使用大家都熟悉的测试项目进行了前端/后端/Agent能力测试, 从测试来看, 复杂项目前端能力(建模, 空间理解, 物理模拟等)略有下降, 但后端和 Agent 能力有明显提升. 不过如果你是纯做网站的话, 可以用 kimi 网站上的的 k2.6 Agent 模式, 由于 Agent 能力足够强所以可以在这个模式下多步来提升生成的网站质量和交互体验. #kimi #kimik26 #moonshot #月之暗面 #kimicli
karminski-牙医40,177 views • 4 months ago