Загрузка видео...

Не удалось загрузить видео

На главную

使用了一天的Claude Fable 5: 1️⃣确实很强,两个月前的陈年老bug,在只开了high档的情况下一发入魂解决了。 2️⃣速度快,消耗也快。 3️⃣对前端的理解和执行能力断档式的领先。 其它的能力不好量化展示,放一个 Fable 5生成的网页。 推荐用法:碰到Opus和GPT-5.5都搞不定的问题再上Fable。 目前最大的问题就是6月22日以后官方订阅套餐不能用Fable,只能走API。Fable能力很强,但是调用官方API的费用不低,不过想省点钱的办法还是有的,我推荐的方案是用Zenmux,支付方便,Visa卡和支付宝都支持。目前有个充20美元送10美元、充50美元送30美元的活动,总体算下来比直接用官网API划算,可以趁着有活动先充值囤着。 我的建议是一定要备一个API,真碰到难题了,上Fable,能省不少时间。

41,366 просмотров • 3 месяцев назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

Claude Fable 5 重新开放了 最近刚好有一个demo,就是看能不能用顶级模型做一个meme工厂 “ 就是我输入一个 Meme Coin 创意 然后这个工具自动生成品牌 / 叙事 / 经济模型 / 营销方案 支持中文全流程输出,可以反复优化迭代 “ 也是想尝试一下,做一个可以验证 Fable 5 长任务能力 最终做出了一个能够简单跑的框架(我没有投入任何信息源,没有喂数据 所以跑起来效果没有那么屌,不过我觉得后期再投喂一些案例,我觉得确实是可以落地的) 说说我为什么用Fable 5 来测? 因为这个任务本质不是写代码 更像是说去测试AI的长链路规划能力测试 它需要: 1/ 语义理解 2/ 叙事能力 3/ 结构能力 4/ 一致性 5/ 自我检查 这刚好是 Claude Fable 5 主打的能力 整体跑下来我觉得还算是可以的,毕竟我这种不会写代码不会设计的小屌丝,确实在Fable 5 上面使用得其乐融融的 哈哈 再说说我的TOKEN使用量吧:112.31K(按照官方的收费标准大概是在:$4.2) 要是加上文本案例 再接入一个AI对话的API框架 我觉得应该费用还要再多出个大几十吧(个人猜测,毕竟投喂数据可能会比较烧tokens) 总的来说的话我个人还是觉得这笔消费还算挺值得的,因为这本身在传统行业的话 可能会是比较高的费用,AI真的弄挺好的 说完Claude Fable 5的体验, 那我不得不说我是在哪里体验的Claude Fable 5了 我这次没有走官方通道,而是走的是我之前给大家分享的中转站 Zenmux ZenMux 因为他这几天又搞活动了,只要你账号的余额>$0 你就可以免费体验Claude Fable 5 并且 Zenmux支持(不限于): 200+ 模型统一入口 无 RPM 限制 PK 模式 可以直接做横评 如果大家也想低成本体验一下 Claude Fable 5 我觉得当前使用Zenmux是最好的选择

车九

48,436 просмотров • 2 месяцев назад

用了两天的Fable-5,得到了一个与大部分人截然相反的结论,实测体验如下: 速度:非常慢,尤其是开始分析和规划的时候能感受到像乌龟慢爬 价格:我是Max5订阅用户,虽然输入输出定价为Opus的两倍,但是实际消耗量并没有像流水一样,消耗速度确实变快了,但命中缓存后消耗没有特别高,没有人传人的消耗那么离谱的快 所以铺天盖地说消耗非常快的只有三种可能: 第一种是Pro订阅账号容量本来就小, 第二种是没自己账号纯造谣, 第三种是本来对Opus的消耗没有感知,看到别人说fable消耗快自己也一用发现消耗快于是觉得是真的消耗快了。本身Opus的消耗就非常快嘛,现在只不过是变为了原来的大概1.5x 对于我来说,我通常只用Opus,所以这个1.x倍Opus的消耗量能够接受。实际使用中建议把缓存重建修改为1小时。 能力:能力强体现在思维边界更广,架构能力更强。 对于前端能力测试确实是有很大提高,尤其是创意能力。真正落地到工程项目中,我的体感是能够真正发现GPT-5.5的问题了,不会再像之前基本一直认为GPT的分析是对的。 实际能力类似于Claude Opus4.6++与GPT-5.5++的结合版,目前没有到非常惊艳的程度 结合价格和6月22之后就没了,我也没有升级Max20的打算,Max5+GPT-5.5乃至即将出现的5.6我觉得完全够用。也建议大家理性消费。如果想走按量体验可以看下评论区。 最后给大家看一下昨晚用Fable简单构建的前端的效果,关于为什么我吐槽过还要做前端,是因为我也需要在抖音小红书炸裂搞流量,人作为视觉动物,前端是最开始抓住注意力的开头的。 视频如下,网站部署在verel地址放在评论区了,大家可以自行查看

雪踏乌云

24,345 просмотров • 3 месяцев назад

🔥 重磅消息:昨晚刚上线的Claude Opus 4.6 可以免费用了! ZenMux把这个模型给免费开放了,目前是限时 2 周免费体验。 这可能是今年最良心的 AI 福利了——要知道官方 Claude Pro 订阅一个月就要 $20,而且还有额度限制。 说实话,我自己最近已经被额度问题困扰很久了。 这已经是这个月第三次了——上周用 Claude Code 重构了一个项目,刚生成了大概 2000 行代码,额度直接没了就~~ 然后就是熟悉的循环:要么等下个月重置,要么就是再充钱。这种“写到一半突然卡住”的感觉,真的太难受了,大家应该懂得。 而我又是一个完全不懂代码的 Vibe Coding 选手,所有的东西都得靠 AI,手工是绝对不可能的,所以消耗 Token 的速度比谁都快。 所以今早看到 yamilet 第一时间支持了 Claude Opus 4.6,还包含了 GPT-5.2、Gemini 3 Pro 这些最新模型。 加上他们最新上线了一个 Builder Plan 订阅制,限量 999 份,我就赶紧抢了一个。 我的实际体验: 1、注册后直接选 Pro 套餐($20/月),直接支付宝付款 2、拿到 API Key 之后,复制到 VS Code的设置里(替换我原来的 Anthropic Key) 3、打开项目,直接用Claude Code插件,然后选 Claude Opus 4.6,开始继续写代码,不用担心 Token 然后我做了个测试: 让 Claude Opus 4.6 帮我写一个完整的用户认证模块,包括: -- JWT token 生成和验证 -- 密码加密和校验 -- 刷新 token 机制 -- 错误处理和日志记录 生成了大概 500 行代码,前前后后改了 3 次,一点心理负担都没有。 以前用官方订阅的时候,每次让 AI 重新生成代码,我都会犹豫一下:“这次改动值不值得再消耗一次额度?” 现在完全不用想这个问题了。这种固定月费的模式,我爱怎么折腾怎么折腾。 更爽的是: 因为 ZenMux 聚合了所有主流模型,我可以直接在 VS Code里切换: -- 写复杂逻辑用 Claude Opus 4.6(推理能力较强) -- 写单元测试用 GPT-5.2(格式比较规范) -- 优化性能用 Gemini 3 Pro 一个 API Key,三个顶级模型随便切换,这种体验真的回不去了。 算了一下成本 以前: ChatGPT Plus $20 + Claude Pro $20 = $40/月,还经常不够用 现在: ZenMux Builder Plan Pro $20/月,等价 $100 的 API 用量,目前完全够用 如果你是商业项目或者生产环境,ZenMux 也有按量付费模式,企业级 SLA 保障。我个人项目用订阅制,公司项目用按量付费。 👉 体验地址:

鱼总聊AI

37,827 просмотров • 7 месяцев назад

试了一下 OpenAI 新出的 Codex App,有些亮点 跟 Skills 的适配还是有点问题,模型的主要问题就是慢 OpenAI 给 Pro 和 Plus 用户的 Codex 额度在未来两个月内全部翻倍了 👇看一下详细的能力介绍: Skills 可视化管理 有一个专门的 Skills 列表界面,预置了一些官方 skills,也可以扫描你已经安装的 skills。注意这里只能扫描 NPX 安装的,本地创建的(比如在 Claude Code 里创建的)扫不出来。 还支持 Skills Creator 创建的 skills,可以直接在 APP 里用它去创建新 skills。 ------ 定时任务功能,这个挺实用的。 可以让 AI 定期执行某些任务,比如每周给你一个解决问题的报告,定期去解决某个项目的 PR 问题,或者定期 review 代码。 对于需要持续维护的项目来说,这个功能还是挺有价值的。 ------ Codex APP 现在支持计划模式了。 因为它跟 Codex CLI 共享后端,所以现在 Codex CLI 也同步支持计划模式了。这意味着 AI 会先规划任务步骤,让你确认后再执行。 ------ 用量显示的样式做得挺好的。 进度条、余量、使用情况都很清楚,一眼就能看到你还有多少额度。 还有 code review 的快捷方式,可以快速调用你的 skills。MCP 的添加也支持。 ====== 实测:用 video-wrapper skill 跑了一遍 我测试主要是让它跑了一个我最近做的 skill,可以一键给视频添加视频包装,比如卡片、花字、人物条、章节标题这些。 这个 skill 挺复杂的,所以很适合用来测试。 ------ 第一次运行的问题 可以工作,但第一次它选了 PIL 这个方案,比较差。 核心问题是什么?它跟你没有交互。 我的 skill 里边写清楚了:要先问用户要哪套方案,再给出包装方案让用户确认,用户确认了再开始包装。 但在 Codex 这里,明显没有交互。它就直接跑,把所有决定都自己做了,跑完就完了。出错了也不管,直接用降级方案。 ------ 修复后的效果 我让它修复以后,它倒是能修复。重新跑了一遍,效果也不错。 最终生成的视频包装效果还行: ▸ 左下角有人物卡片 ▸ 有花字 ▸ 有各种卡片和章节标题 ▸ 结论卡片也加上了 因为我们用前端代码约束了样式,所以它在样式上不会出什么错误。 ------ 体验总结 整个过程很不可控: ▸ 速度很慢 - Codex 本身速度就慢 ▸ 交互明显不够 - 你根本不知道进到哪个阶段了,也不知道它的方案是什么 ▸ 只管执行 - AI 一直在执行,不会停下来问你 可能是它不太适应 skills 规范,只是简单做了一下适配,没有 Claude Code 跟 skills 的适配那么好。

歸藏(guizang.ai)

30,595 просмотров • 7 месяцев назад

我让 GPT-6 Astra 和 Claude Fable 5.1 审同一份代码,Astra 的账单便宜了 26.4%。 点开日志,Astra 的 9,832 个输出 token 里,有 7,250 个属于推理,占 73.7%,扣掉推理后,剩下的 token 大约是 Fable 的一半。 这次对照是在 ZenMux 上跑的,同一个 key 可以切模型,调用记录能展开每项费用,方便把两边放在一起核算。后面接入 Codex,又查了一次模型定价接口,我找到了另外两处只看总账单容易忽略的成本。 先说审代码这次。 测试材料是我自己项目里的自动评分器,163 行 Python,公开在 GitHub 的 ling-fin-eval 仓库。 左边 GPT-6 Astra,右边 Claude Fable 5.1,同一段 prompt 同时发,要求把问题分三类,每条给确切行号和理由,没把握的明确写“未验证”,不要自行补全。 Astra 报了 20 条,另列 4 条未验证;Fable 报了 37 条,并逐条标注把握程度。 两边的账单和输出放在一起,是这样。 项目GPT-6 Astra,Claude Fable 5.1 总费用0.5331 美元,0.7245 美元 输出 token9,832,13,278 推理 token7,250,8386 输出减去推理2,582,4,892 Astra 这次确实少花了 26.4%,总输出 token 也更少。 我又做了一个折算。按 output token 包含 reasoning token 的口径,用总费用除以两者相减后的 token 数,再换算成每百万 token。 Astra 是 206.47 美元,Fable 是 148.10 美元,前者高出 39.4%。 这个数只表示本次总费用分摊到非推理输出后的成本。,它依赖两边字段口径一致,也不能直接代表审查质量。回答长短、问题条数都只是表面数量,误报和遗漏需要逐条核验。 这组数据让我对“输出更少”多留了一个心眼,只看 9,832 和 13,278,会漏掉输出内部的构成。 ZenMux 在这里省了接入和对账的步骤,我可以在同一个平台切模型,再展开两条调用记录看费用,实际参数和缓存状态仍要单独记录,同一个 key 不会自动让这些条件一致。 接下来这笔更直观。 我把 Codex 接到 ZenMux,问了一个很简单的问题:“用一句话说明 norm() 函数做了什么。” 它答对了,还给出了 第 7 行。我回源核过,行号精确命中。 其中一条调用记录的费用是 0.2482515 美元,拆开如下。 费用项token 数,费用(美元) 占比缓存读取 input_cache_read 182,934,0.182934,73.7% 缓存写入 input_cache_write,3,519 0.0439875 17.7% 输出 completion,413,0.020650 8.3%普通输入 prompt68,0.000680,0.3% 合计0.2482515 100% 输出费用只占 8.3%,大约十二分之一,缓存读取和写入合计占了 91.4%。 这条记录中的输入类 token 加起来有 186,521 个,对照我只问了一句函数解释,这个输入量很值得继续查。 Agent 请求会携带上下文,系统提示、skills 清单、AGENTS.md 和读入的文件,都可能贡献输入,但仅凭费用表,还不能确定它们各占多少。 缓存读取占比高,也不能直接判成缓存浪费,这里读缓存的单价是普通输入的十分之一。需要继续检查的是,任务带入了哪些上下文,其中多少确实需要。 有了逐项账单,排查方向就清楚了。这条记录里,输出只占很小一部分,输入上下文值得优先检查,整次任务花了多少钱,则要把相关请求一起算进去。 第三处发现来自定价接口,也纠正了我自己的一个推断。 ZenMux 模型页给 Astra 标出的价格区间是输入 10 至 20、输出 50 至 75 美元/百万 token,我最初把这个区间理解成了 low、medium、high 等推理档位,还专门去问了品牌方。 后来查了公开的 models 接口,定价条件写的是 prompt_tokens。 截至 2026 年 9 月 6 日,Astra 的定义如下,单位均为美元/百万 token。 费用项,单次请求 prompt < 272K 单次请求 prompt ≥ 272K 输入10,20 缓存写入,12.5,25 缓存读取1,2输出50,75 这个区间对应长上下文阶梯,达到 272K 后,输入和缓存单价翻倍,输出单价上涨 50%。 接口列出的这组价格条件没有按 effort 分档,effort 仍可能改变实际使用的 token 数,进而影响总费用。 272K 要对照单次请求的 prompt token,不能拿整个 agent 任务多次请求的累计输入来比较。不同模型的阶梯也要逐个看,这张表只适用于接口当前列出的 Astra 定义。 超过门槛后的实际扣费,我没有另外发请求验证。 这几笔账查完,我用 ZenMux 的理由更具体了,换模型时可以沿用同一个 key,跑完以后能在同一个地方对照调用记录,再追到输入、推理、缓存和各项单价。 推理 token 数也能从部分官方 API 的 usage 字段里拿到,例如 OpenAI 就有相应字段,ZenMux 对我这次工作的帮助,是把多模型调用和费用查看集中起来,减少自己整理不同接口数据的步骤。 限时充值活动: 充 50 美元得 70(送 20) 充 100 美元得 150(送 50) 限 9.4-9.11 ,一共是7天,每个账号限兑一次 活动入口和当前状态以官网为准: #ZenMux

阿良|AI 工作流

64,596 просмотров • 7 дней назад

昨天Claude Fable 5一发布就引起轰动,但看数据是挺亮眼的,今天刚抽出时间来,我在ZenMux 拿 Fable 5 和 Claude Opus 4.8做个横向比较 case我没有选传统的数学题、代码题或者常识问答,而是设计了一份更接近真实工作的混乱 brief: 一家公司要在两周内上线“企业知识库 AI 助手”,目标用户是销售和客服,资料分散在飞书、PDF、Notion、客服工单和销售话术库里。 难点在于,brief 里有很多真实项目才会出现的冲突:CEO 希望尽快上线,还想支持所有资料源;客服负责人担心 AI 乱答;法务要求合同、价格、退款、合规相关问题必须有引用来源;技术团队只有 2 个后端、1 个前端,还在做另一个高优项目;权限系统也只能做到部门级,做不到文档级。 我要求模型直接给出 V1 方案,包括范围取舍、风险冲突、两周上线计划、验收指标和假设条件。 评估时重点看 6 个点: 1.是否敢收敛范围 好答案应该只做飞书文档 + PDF,最多先服务销售/客服核心场景。Notion、客服工单、市场 FAQ、多源全接入都应该放到 V1 之后。 2.是否识别硬冲突 两周上线、所有资料源、权限不足、法务要求引用、CEO 想快上,这些是核心冲突。 3.是否处理高风险回答 合同、价格、退款、合规必须“有引用才答,无引用拒答”,最好加高风险问题模板或人工确认。 4.是否给出真实 2 周计划 不是“第 1 周开发,第 2 周上线”这种废话,而是能拆到数据整理、权限、引用、评测集、灰度、日志、回滚。 5.是否不乱编 不能编公司人数、预算、历史准确率,也不能假设已有 Notion API、文档级权限已经完成。 6.是否有产品判断 能给出统一成功指标,比如:引用覆盖率、拒答正确率、Top 问题准确率、试点用户节省时间,而不是只堆 DAU。 最后看下来,根据预设的结果评估标准,我的评分是 Fable 5:8.7/10 Opus 4.8:8.1/10 Opus 4.8 的表现依然很稳。它准确抓住了这个项目的核心风险:现有 RAG 原型“引用来源不稳定”,而这个产品又高度依赖引用和拒答机制,所以引用不稳定就是 P0 问题。它也比较克制,没有乱编用户数、预算、历史准确率,这点很加分。 但 Fable 5 在这道题里更有“真实项目推进感”。它不只给原则,还把方案拆到了数据白名单、拒答模板、日志审计、评测题集、种子用户灰度、Go/No-Go 决策。尤其是它提出“只导入全部门可见文档,规避文档级权限缺失”,这个细节很产品化,也很符合真实企业落地时的权衡。 换句话说,Opus 4.8 更像一份高质量分析稿,Fable 5 更像一份可以拿进评审会推进的决策稿。 当然,Fable 5 也有需要保留意见的地方。它会主动给一些验收阈值,比如引用有效率、可用率等,这让方案更可执行,但也带来一个问题:如果 brief 没有给历史数据,这些数字其实需要进一步校准。相比之下,Opus 4.8 在这一点上更谨慎。 所以这次测试我的结论比较克制:Fable 5 没有形成压倒性优势,但在复杂 brief、范围管理、风险闭环和执行颗粒度上,确实比 Opus 4.8 更往前走了一步。 如果后续继续测,我会重点看它在 Agentic workflow 里的表现,比如长任务拆解、多轮修正、代码仓库修改、工具调用后的复盘。单题不能证明模型全面领先,但至少这次测试说明:Fable 5 在“把混乱需求变成可执行方案”这类任务上,值得认真关注。 对了借着现在ZenMux 有充 20 美元 送 10 美元、充 50 美元 送 30 美元的限时充值返赠活动 建议都可以趁这个机会可以去试一下,看看Claude Fable 5的能力是否符合你的预期 活动限时一周,每位用户限享一次,链接我放在评论区👇

阿川 | AI thinking

11,047 просмотров • 3 месяцев назад