Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

Pi 用久了,接模型这件事越来越麻烦。 每家模型平台都有自己的账号和 Key,余额散在几个地方。想把同一个任务换个模型再跑一遍,又要重新配置、充值和查账。模型接得越多,配置也越乱。 这次我把 ZenMux 接进 Pi,只维护一个 provider 和一把 Key。 GPT-6 Astra 上线后,我直接在 Pi 里选择 openai/gpt-6-astra,然后做了几个测试测试模型的真实性。 1、模型名称,看看是不是真的GPT-6 2、模型的写作能力,看看最新模型在写作上的提升 3、修改一个代码里面的Bug,测试真实的能力 以后想用同一个任务对比其他模型,直接在 Pi 里切换模型即可。实际 token 和花费也能放在同一处看,省掉了到处找 Key、查余额的麻烦。 GPT-6 Astra 面向复杂 agent 工作流。这次我主要看它能不能把跨文件任务做完整,以及输出里有多少内容可以直接使用。官推提到它通常会减少输出 token,录屏里的实际数字会更有参考价值。 ZenMux 本场还有 7 天限时充值活动。 充 $50 得 $70 充 $100 得 $150 每个账号限兑一次 原本就准备跑 API 的,可以趁这次多留一点测试额度。 GPT-6 Astra

20,221 görüntüleme • 4 gün önce •via X (Twitter)

19 Yorum

前端哥Liam profil fotoğrafı
前端哥Liam4 gün önce

zenmux 上架新模型的速度真的非常快,可以用支付宝支付,非常方便

小墨同学 profil fotoğrafı
小墨同学4 gün önce

我都是看他的模型这么丰富 才开始玩玩的

阿蔺A-Lin profil fotoğrafı
阿蔺A-Lin4 gün önce

优惠力度还挺大的

小墨同学 profil fotoğrafı
小墨同学4 gün önce

可以先玩玩 好了再开始付费

Yuze profil fotoğrafı
Yuze2 gün önce

Pi 用久了最烦的就是 Key 和余额散落各处,换个模型还要重新配。接进 ZenMux 只维护一个 provider 一把 Key,Pi 里直接选 openai/gpt-6-astra,同一任务切模型、看 token 和花费都在一处。Astra 适合跨文件把活干完,输出也能直接用。

睿奇Re7 profil fotoğrafı
睿奇Re74 gün önce

ZenMux 充 50 得 70、充 100 得 150,限兑一次。本来就要跑 API 的话,这 7 天把测试额度先囤一点挺划算,我已经冲了

zhangfq profil fotoğrafı
zhangfq2 gün önce

ZenMux 现在能直接选 GPT-6 Astra 了,一把 Key 就能切,省事不少

Evan.Z profil fotoğrafı
Evan.Z4 gün önce

一把 Key 管所有模型,这个才是日常真正省心的地方。跨文件任务能跑完整才算过关,token 和花费还能同一处对账。

OA🦁 profil fotoğrafı
OA🦁3 gün önce

模型接得越多之后,最烦的确实不是调用本身,而是Key、余额和配置全散着 能把模型切换和用量统一到一个地方,对经常横向测模型的人省事很多

MapleShaw profil fotoğrafı
MapleShaw3 gün önce

把模型、Key、余额和账单都收进 Pi 里,确实比到处翻后台舒服,尤其适合反复做横向测试。

Kriano profil fotoğrafı
Kriano3 gün önce

This is where model gateways become really useful. One provider, one key.all things

ljh profil fotoğrafı
ljh4 gün önce

只有我一个人只用得起ds吗😂

小墨同学 profil fotoğrafı
小墨同学4 gün önce

应该大部分ds都要用不起了,涨价太厉害了

ljh profil fotoğrafı
ljh4 gün önce

谷点和周末的时候用flash 4.1,之前又说上昇腾,现在看来遥遥无期

小墨同学 profil fotoğrafı
小墨同学4 gün önce

乌兰察布那里有新的数据中心 所以可以再等等

50饭binance林川 profil fotoğrafı
50饭binance林川4 gün önce

终于不用再配环境了

Bigkaka profil fotoğrafı
Bigkaka4 gün önce

不麻烦啊,加到 .profile 就好了,全自动读取

RedJACK profil fotoğrafı
RedJACK4 gün önce

zenmux的GPT也得有梯子吧

小墨同学 profil fotoğrafı
小墨同学4 gün önce

我到时没测过要不要,但是直接访问是可以直连的

Benzer Videolar

兄弟们,DeepSeek V4 Pro在ZenMux上免费放开了,登录就能跑,实测能替掉你80%的Claude活。视频是我早上实测的和Claude opus 4.7同时跑一个昨SaaS产品网站的任务,效果真的炸裂! 说个前情,老朋友都知道我今年Claude被封过一次号,那之后我就想通一件事——API这种东西绑死在单一厂商手里是给自己埋雷,付费用户说封就封,申诉通道石沉大海,深夜破防一次就够了。 从那之后我转战聚合平台,试了一圈最后留在ZenMux,半年用下来没再折腾过。 所以这次V4 Pro在ZenMux上免费开放,对我来说不是又一个新模型上线,是我一直在用的平台又多了一张能打的牌,顺手就想推给兄弟们。 先说V4 Pro到底值不值得冲, 这几天X上吹V4 Pro的推刷屏了,参数跑分价格屠杀,都是同一个模板。 但对我这种每个月真金白银付API账单的人来说,跑分都是虚的,能不能替掉我手头项目里的Claude调用才是真问题。 免费窗口就是用来验证这件事的, 我这昨天就干了一件事——用ZenMux的PK模式把V4 Pro、GPT-5.4、Claude Opus 4.6摆在同一屏,拿自己项目里最头疼的prompt开跑,三栏并排输出,谁快谁慢谁token烧得少一眼看完。 四个场景跑完结论很清晰——日常80%的活V4 Pro能接,便宜到让我下不去手再用Opus,剩下20%极限稳定性的关键链路我还是留给Claude兜底。 这就是模型分层,上周讲Ling的时候也提过这个逻辑,2026年不存在一个模型打天下,只存在你工具箱里的模型组合。 顺便说说ZenMux这平台为啥值得留下来。 PK模式是第一个杀手锏,三家模型同屏对比这种功能市面上很少有平台做,每次选模型省我一整个下午,比自己写脚本调三家API再人肉对比快十倍。 真正让我踏实的是保险赔付机制,模型输出异常或者延时拉胯,平台自动检测并补偿。 被Claude封过号之后再看到这个设计,感觉完全不一样,出问题有人兜底,不用再深夜破防。 再加上日志、成本、用量、性能四个维度的可观测性做得细,每一笔钱烧在哪、每一次请求卡在哪点开就能看,调prompt和选型的时候非常好使。 回到这次的白嫖窗口, DeepSeek V4 Pro和Flash都有免费版,每天有用量限制但够你跑测试。 这几天想验证要不要换模型的兄弟,别再刷跑分推了,自己扔几个真实prompt进去跑一遍,十分钟你就知道该不该换,比谁的测评都诚实🌚 免费入口老规矩评论区自取⬇️ #DeepSeekV4 #ZenMux #AI #大模型 #Agent

AYi

132,811 görüntüleme • 4 ay önce

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是 100B 以内的模型无敌手了, 考虑到定位可能是个新的技术试验模型, 所以期待千问推出更大规模 (例如400B-A15B) 的模型, 带来更好的性能. 测试 prompt: #Qwen3Next #大模型竞技场 #Qwen3

karminski-牙医

30,709 görüntüleme • 1 yıl önce

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,630 görüntüleme • 5 ay önce

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 görüntüleme • 5 ay önce