Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

再也不用挨个官网注册绑卡试模型了, 136个免费LLM被整合成了一个站啦! 53个经过API实时验证,没有失效链接凑数。 DeepSeek V4 Pro,Kimi K2.6,GLM 5.1, Minimax M3,Mistral主流型号全覆盖, 支持按能力维度筛选, 文本代码视觉音频推理一键分类,上下文长度速率限制一目了然, 搭Agent跑实验尤其顺手, 生成API密钥就能直接接入Hermes OpenClaw Codex, 测试阶段能省一大笔API成本, 免费额度普遍带速率限制, 适合开发测试和小流量场景, 生产环境建议自行评估稳定性。 地址放评论区👇

12,167 Aufrufe • vor 2 Monaten •via X (Twitter)

6 Kommentare

Profilbild von 0x小蝴蝶
0x小蝴蝶vor 2 Monaten

再也不怕挨个注册了太方便

Profilbild von AYi
AYivor 2 Monaten

是滴,收藏起来宝子

Profilbild von 加密小侦探
加密小侦探vor 2 Monaten

看下私聊

Profilbild von Kiki
Kikivor 2 Monaten

冲了嘻嘻

Profilbild von 安叫兽|Bird🕊️ 🔶 BNB
安叫兽|Bird🕊️ 🔶 BNBvor 2 Monaten

这下少折腾好多注册流程

Profilbild von AYi
AYivor 2 Monaten

对啊,宝藏网站

Ähnliche Videos

Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏! 给大家带来刚刚正式发布的 kimi-k2.6 的正式版本的实测! 本次为了考验它的长程Agentic Coding能力, 我用 kimi-k2.6-code-preview 写了个 harness 游戏自动生成框架, 它可以根据给到的人设/场景/数值设计等规则, 自动生成关卡, 背景图片, 甚至配音! 其中框架驱动和草稿模型使用 kimi-k2.6, 文生图和生成语音由 kimi-k2.6 生成 prompt 后调用其它大模型生成. 最好玩的是, 我做了个"无头"版本的游戏cli接口, kimi-k2.6 能像玩互联网早期Mud游戏一样, 使用纯文本玩这个游戏, 每当它生成关卡之后, 他就可以直接进入游戏游玩一下, 来验证关卡设计得是否正确. 而内部设计又分为了对话生成skill, 脚本生成skill, 关卡生成skill, 游戏测试大师skill, 游戏资深玩家skill(由于检讨游戏性) 等等, 从而实现了让大模型自己写游戏自己玩! 每个关卡大概需要一个小时生成和验证, 如果并行验证应该还能更快一些(做多线程BFS/DFS). 另外本次依旧使用大家都熟悉的测试项目进行了前端/后端/Agent能力测试, 从测试来看, 复杂项目前端能力(建模, 空间理解, 物理模拟等)略有下降, 但后端和 Agent 能力有明显提升. 不过如果你是纯做网站的话, 可以用 kimi 网站上的的 k2.6 Agent 模式, 由于 Agent 能力足够强所以可以在这个模式下多步来提升生成的网站质量和交互体验. #kimi #kimik26 #moonshot #月之暗面 #kimicli

karminski-牙医

40,177 Aufrufe • vor 4 Monaten

🔥 重磅消息:昨晚刚上线的Claude Opus 4.6 可以免费用了! ZenMux把这个模型给免费开放了,目前是限时 2 周免费体验。 这可能是今年最良心的 AI 福利了——要知道官方 Claude Pro 订阅一个月就要 $20,而且还有额度限制。 说实话,我自己最近已经被额度问题困扰很久了。 这已经是这个月第三次了——上周用 Claude Code 重构了一个项目,刚生成了大概 2000 行代码,额度直接没了就~~ 然后就是熟悉的循环:要么等下个月重置,要么就是再充钱。这种“写到一半突然卡住”的感觉,真的太难受了,大家应该懂得。 而我又是一个完全不懂代码的 Vibe Coding 选手,所有的东西都得靠 AI,手工是绝对不可能的,所以消耗 Token 的速度比谁都快。 所以今早看到 yamilet 第一时间支持了 Claude Opus 4.6,还包含了 GPT-5.2、Gemini 3 Pro 这些最新模型。 加上他们最新上线了一个 Builder Plan 订阅制,限量 999 份,我就赶紧抢了一个。 我的实际体验: 1、注册后直接选 Pro 套餐($20/月),直接支付宝付款 2、拿到 API Key 之后,复制到 VS Code的设置里(替换我原来的 Anthropic Key) 3、打开项目,直接用Claude Code插件,然后选 Claude Opus 4.6,开始继续写代码,不用担心 Token 然后我做了个测试: 让 Claude Opus 4.6 帮我写一个完整的用户认证模块,包括: -- JWT token 生成和验证 -- 密码加密和校验 -- 刷新 token 机制 -- 错误处理和日志记录 生成了大概 500 行代码,前前后后改了 3 次,一点心理负担都没有。 以前用官方订阅的时候,每次让 AI 重新生成代码,我都会犹豫一下:“这次改动值不值得再消耗一次额度?” 现在完全不用想这个问题了。这种固定月费的模式,我爱怎么折腾怎么折腾。 更爽的是: 因为 ZenMux 聚合了所有主流模型,我可以直接在 VS Code里切换: -- 写复杂逻辑用 Claude Opus 4.6(推理能力较强) -- 写单元测试用 GPT-5.2(格式比较规范) -- 优化性能用 Gemini 3 Pro 一个 API Key,三个顶级模型随便切换,这种体验真的回不去了。 算了一下成本 以前: ChatGPT Plus $20 + Claude Pro $20 = $40/月,还经常不够用 现在: ZenMux Builder Plan Pro $20/月,等价 $100 的 API 用量,目前完全够用 如果你是商业项目或者生产环境,ZenMux 也有按量付费模式,企业级 SLA 保障。我个人项目用订阅制,公司项目用按量付费。 👉 体验地址:

鱼总聊AI

37,827 Aufrufe • vor 7 Monaten

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 Aufrufe • vor 5 Monaten

兄弟们,DeepSeek V4 Pro在ZenMux上免费放开了,登录就能跑,实测能替掉你80%的Claude活。视频是我早上实测的和Claude opus 4.7同时跑一个昨SaaS产品网站的任务,效果真的炸裂! 说个前情,老朋友都知道我今年Claude被封过一次号,那之后我就想通一件事——API这种东西绑死在单一厂商手里是给自己埋雷,付费用户说封就封,申诉通道石沉大海,深夜破防一次就够了。 从那之后我转战聚合平台,试了一圈最后留在ZenMux,半年用下来没再折腾过。 所以这次V4 Pro在ZenMux上免费开放,对我来说不是又一个新模型上线,是我一直在用的平台又多了一张能打的牌,顺手就想推给兄弟们。 先说V4 Pro到底值不值得冲, 这几天X上吹V4 Pro的推刷屏了,参数跑分价格屠杀,都是同一个模板。 但对我这种每个月真金白银付API账单的人来说,跑分都是虚的,能不能替掉我手头项目里的Claude调用才是真问题。 免费窗口就是用来验证这件事的, 我这昨天就干了一件事——用ZenMux的PK模式把V4 Pro、GPT-5.4、Claude Opus 4.6摆在同一屏,拿自己项目里最头疼的prompt开跑,三栏并排输出,谁快谁慢谁token烧得少一眼看完。 四个场景跑完结论很清晰——日常80%的活V4 Pro能接,便宜到让我下不去手再用Opus,剩下20%极限稳定性的关键链路我还是留给Claude兜底。 这就是模型分层,上周讲Ling的时候也提过这个逻辑,2026年不存在一个模型打天下,只存在你工具箱里的模型组合。 顺便说说ZenMux这平台为啥值得留下来。 PK模式是第一个杀手锏,三家模型同屏对比这种功能市面上很少有平台做,每次选模型省我一整个下午,比自己写脚本调三家API再人肉对比快十倍。 真正让我踏实的是保险赔付机制,模型输出异常或者延时拉胯,平台自动检测并补偿。 被Claude封过号之后再看到这个设计,感觉完全不一样,出问题有人兜底,不用再深夜破防。 再加上日志、成本、用量、性能四个维度的可观测性做得细,每一笔钱烧在哪、每一次请求卡在哪点开就能看,调prompt和选型的时候非常好使。 回到这次的白嫖窗口, DeepSeek V4 Pro和Flash都有免费版,每天有用量限制但够你跑测试。 这几天想验证要不要换模型的兄弟,别再刷跑分推了,自己扔几个真实prompt进去跑一遍,十分钟你就知道该不该换,比谁的测评都诚实🌚 免费入口老规矩评论区自取⬇️ #DeepSeekV4 #ZenMux #AI #大模型 #Agent

AYi

132,811 Aufrufe • vor 4 Monaten

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是 100B 以内的模型无敌手了, 考虑到定位可能是个新的技术试验模型, 所以期待千问推出更大规模 (例如400B-A15B) 的模型, 带来更好的性能. 测试 prompt: #Qwen3Next #大模型竞技场 #Qwen3

karminski-牙医

30,709 Aufrufe • vor 1 Jahr