Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

Github上有个开源项目,把12家主流大模型平台的免费额度打通成一个统一入口 你把零散的API key往里一填,转手就能薅几亿token 用法也很简单: 1、clone到本地,打开管理后台 2、把手头的key依次填进去 3、去Playground发条测试消息,会直接显示是哪家模型在答、延迟多少ms 配完之后复制统一的URL和API key,给模型排好优先级 有任务进来会自动按顺序轮询,某家限速了就自动跳下一家,直到把活干完

17,183 görüntüleme • 3 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

34家AI平台的免费额度,每月能白嫖74亿Token。 最有用的还不是这个数字。 Codex或者Claude Code跑到一半,当前接口被限速、返回429,它会自动换下一条可用线路,不用停下来换Key、改地址、重启任务。 这个开源项目叫FreeLLMAPI。 免费API名单其实到处都是,真正麻烦的是:每家的接口地址、模型名和限速规则都不一样。 Google能用多少次,Groq还剩多少额度,Cerebras什么时候被限速,平时全要自己记。一个接口挂了,还得手动修改配置再重新跑。 FreeLLMAPI把这些零散额度接成了一个统一的/v1接口。 把自己申请到的免费Key放进去,它会记录每个Key的RPM、RPD、TPM和剩余额度。当前线路被限速或者报错,就暂时跳过,自动尝试下一家。 目前已经整理了34家AI平台、474个模型系列和635个免费接口。 Codex CLI、Claude Code、Cursor、Gemini CLI、Aider、Cline这些工具都能接,官方也提供了Mac、Windows和Docker的安装方式。 不过先说清楚: 它不是破解,也不会直接送你74亿Token。各个平台的免费Key仍然需要自己申请,74亿只是把34家平台的理论免费额度全部相加。 更适合个人学习、跑Agent和临时测试,不适合拿去跑商业生产。 我看到时项目约2.08万星,本周新增约1700星。 对于每天同时跑几个Agent的人,它解决的不是“去哪里找免费API”,是怎么把这些零散额度真正接起来。

DeFi狙击手 | Ai🕊️

20,312 görüntüleme • 1 ay önce

非常Nice啊,这模型完全免费,Token终于可以自由白嫖了,甚至视频模型都是免费的,太爽了。 它叫Agnes AI,全球模型榜前十,6 月 1 号起把自己家三个核心模型全免费开放了,无限期。图片模型在 artificial analysis 上榜了,文字模型一周被干了一万亿 Token。我把它接进 Claude Code,配起来十分钟的事,Token 随便用。 这玩意到底是什么呢。 Agnes AI 是全球模型榜单前十的一个 AI Lab,这次免费开放的是三个模型,文本、图片、视频。 文本模型叫 agnes-2.0-flash。能写代码,能做知识问答,能跑 Agent,能规划复杂任务。在 Claw-Eval 智能体评测榜进了 Top 10。说真的,这周它还要上 1M 超长上下文,以前用 200K 的模型跑到 150K 就降智,这种破事不用再忍了。 图片模型叫 agnes-image-2.1-flash。图改图、多图融合、换背景、改文字、图像修复,电商主图和广告素材这种反复改的场景,太合适了。最近还加了 4K 超高清输出,最高 4096×4096,生成的图可以直接进印刷,不是那种看着还行一放大就糊的草稿。 视频模型叫 agnes-video-2.0。原生音画同步,首帧生视频、首尾帧生视频、多镜头切换都支持,720P 和 1080P 随便选。 接进 Claude Code 怎么搞,其实很简单。 第一步,去 注册,拿到 API key。 第二步,打开 cc-switch。右上角选 Claude CLI,右上角点 + 号,选自定义配置。把 API key 填进去,请求地址写 格式选 OpenAI Chat Completions。 第三步,点获取模型列表,选 agnes-2.0-flash。 第四步,点左上角设置,找到路由,打开路由总开关,Claude 打开。 完事。 回到 Claude Code 正常发消息,模型就已经切过去了。我试了一个在酒吧吉他弹唱的视频,和真人区别不大。 现在 Token 不要钱,Agent 该跑几轮跑几轮,该拆几步拆几步。反正我觉得这才是免费开放最爽的部分,不只是省钱,是心理上解放了。 我测试了一下视频模型,能用,就是慢了点,文字模型还是比较快的。 开发者文档在 OpenClaw、Hermes、Claude Desktop 的,也有现成教程。

产品经理老王霸

55,427 görüntüleme • 3 ay önce

有个事我憋很久了,今天必须说一下。 市面上那些标榜 AI 驱动交易的 Bot,我深度用过几款之后发现一个特离谱的现象:它们所谓的 AI 就是接了一个 GPT 或者 Claude 的 API,把 K 线数据原封不动丢进去,让一个从来没被训练过理解金融时间序列的通用模型给你输出买卖建议。说难听点,跟拿 ChatGPT 算命没什么区别。 所以 AIX 的多模型路由方案,是我接触这个项目之后第一个真正觉得"方向对了"的设计。 它同时接了 GPT、Claude、DeepSeek R1、Gemini 这些通用模型,也集成了 Kronos 这类专门为金融预测训练的专业模型。中间多了一层调度层,根据当前市场状态智能路由,震荡市用一套推理框架,单边趋势切另一套算法组合。 这个设计的聪明之处在于它承认了一个很朴素的事实:没有一种模型能在所有行情里通吃。趋势跟随在单边市是神,进了震荡就是来回止损。反过来网格在震荡舒服,单边一来直接穿仓。通用大模型做策略意图理解很强但看 K 线的能力确实有限,专用金融模型在时序预测上更精准但没办法理解你用自然语言描述的策略逻辑。没有一个模型能同时搞定所有事。 AIX 干的事不是选一个最强的模型然后迷信它,而是让不同模型在不同环节轮班上岗,动态调权重。这个思路在传统量化里叫多因子动态权重,AIX 把它搬到了 LLM 和时序模型的协同上。 我体验下来的感受是它不像那种一问一答的 Bot,更像有一个小团队在后台协作,你只需要给方向,它自己去协调谁干什么。这个架构如果跑通,抗单一模型失效的能力跟那些只接一个 API 的项目不在一个数量级。 个人分享,非投资建议。

DeFi狙击手 | Ai🕊️

17,513 görüntüleme • 2 ay önce

Damn,三天前大家还在争论哪家大模型写代码更便宜, 今天老黄Jensen Huang 和NVIDIA 英伟达直接掀桌子了: 问题根本不在模型, 在你的脚手架太蠢了。 英伟达与 MIT 团队公开了全新架构 SoL-Pi, 放弃人工打补丁, 让算法自己演化出四套运行时机制。 不仅在 GPT-5.6 Sol 和 Opus 5 上守住了评测水准, 更把 API 成本直接削去三分之一。 那些天天盯着大模型降价、却任由 Agent 脚手架疯狂烧钱的团队, 建议把这篇论文打印出来贴在工位上。 英伟达实验室开源的SoL-Pi 论文,可以说是做了一件全行业早就该做的事: 用自动演化系统重新锻造 Agent 运行脚手架。 在 51 个真实编程任务的严苛评测中, 面对 GPT-5.6 Sol 和 Claude Opus 5 这种巨无霸, 任务得分毫发无损, 但直接把 Token 消耗腰斩了 49%, 每跑一小时就能从 API 账单里直接省出 8.75 到 13.50 美元。 很多团队以前做智能体全靠工程师人肉写死调度逻辑, 试几个用例就自以为调好了, 跑进几十步的复杂长任务里, 臃肿的上下文几分钟就能把账单干爆、把模型智商撑死。 英伟达这次最聪明的一步, 是彻底放弃了人类手工调优。 他们把脚手架扔进多个不同的代码环境里, 让系统开启自动化研究循环, 像自然选择一样让无数机制自我对抗淘汰, 最终只有四个物理机制活了下来。 首先颠覆的是执行节奏。 以前 Agent 走一步看一步, 调一次工具往返一次, 动作融合机制直接把连贯动作在端侧合并批处理, 砍掉了一大半网络和上下文震荡。 然后是给运行中的上下文无损脱水。 它不是等上下文满了再调大模型写假大空的摘要, 而是在任务行进中对观察结果进行重组打包, 并在委托阅读长文件时强制保留证据行, 既把整个 API 成本砍掉整整三分之一, 又死死守住了关键代码细节不被遗忘。 以前是工程师凭直觉给 Agent 编死板的笼子, 从今天起是算法在残酷淘汰中自己进化出最精密的骨骼。 如果你的代码 Agent 每小时也能凭空省下十几美元, 你会选择把省下来的钱用来多跑十倍的并发测试, 还是换更大参数的模型? 我先说, 肯定无脑拉满并发, 把原本舍不得跑的全量回归测到爽。 开源代码、论文地址和这套四机制的详细对照表, 我整理好放在一楼了。

AYi

49,296 görüntüleme • 10 gün önce

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

27,376 görüntüleme • 3 ay önce

卧槽,Google/DeepMind 团队最新演示的 AI 递归自我改进论文有点吊炸,奇点要来了吗!? 以前让 Agent 去探索一个复杂的算法或 GPU 算子,每试错一次就要花几十美分、还要等编译跑分,钱包根本扛不住。 谷歌 Dream-RSI 的思路变了:它让模型在过去的历史日志里做梦,用极低成本试完几千种打法,选出最好的再上线实测。 早上好好看了下,发现DeepMind 这篇 Dream-RSI 最值钱的突破其实还不只是让 AI 去修改自身权重, 他们终于找到了一种办法,把调用大模型做探索的成本直接打掉了最高 162 倍。 对正在做代码智能体、自动科研和算法优化的人来说,这篇论文给出了一个极度清醒的工程底座。 它的思路非常克制,一共踩实了三步: 1️⃣ 冻结模型权重,只改战术打法 科幻小说里的自进化,往往是让模型自己改自己的底层代码或权重,结果往往是灾难性遗忘和幻觉暴增; 谷歌第一步就把安全阀焊死了:底层的大模型完全固定不动,它只负责干活; 自我改进的对象,是指导模型去哪里搜索、什么时候回溯、怎么选分支的探索策略。 2️⃣ 把历史残局做成做梦模拟器 这是全篇最聪明的一步。 以前让 Agent 探索长链条任务,最昂贵的是每一步都要真机运行、在线打分; Dream-RSI 把过去跑完的探索轨迹存成了一棵不可篡改的历史树; 这棵树就是环境模拟器,系统可以在离线状态下疯狂做梦,把成千上万种新的探索打法放在历史数据上快速过一遍, 既不需要重新调用大模型生成一遍内容,也不用重复去跑耗时的编译器。 3️⃣ 用历史教训筛选出最佳策略再实战 在沙盒里挑选出得分最高的探索策略后,才把它装载到下一轮真实的业务环境里; 在数学优化、算法设计和 GPU 内核优化的测试中,它不仅拿到了持平甚至更好的方案, 还把在线调用大模型的次数砍到了原本的几十分之一,特定测试下甚至减少了 162 倍。 但看这篇论文必须看清它的取信边界: 这种自我进化之所以成立,是因为算法和 GPU 代码有着极其冷酷的判定器,能不能编译、运行速度快了多少,物理世界会给出绝对确定的分数; 如果换成写文章、做设计等没有客观真理裁判的场景,做梦机制会瞬间退化成自我陶醉的幻觉堆叠。 真正的智能化突破,往往不是靠盲目堆算力去穷举试错; 模型的能力可以固定,但通过沉淀过去的失败轨迹、用最低的代价把搜索战术打磨到极致, 这套把经典强化学习移植进 Agent 系统的框架,给很多被高昂 API 账单卡住的团队,指了一条极其实在的生路。

AYi

27,665 görüntüleme • 13 gün önce

【ZenMux 深度评测第二弹:AI 视频的“动线导演思维”】 在实际动作片拍摄中,动作导演和武指执行一镜到底的格逐戏前,会先设计完整的“动线”——角色从哪进、经哪些节点、在哪完成动作。路径定了,机位反而是被动推导出来的。控制的核心是动线,不是镜头。 用 AI 生成建筑跑酷或一镜到底也是同理。很多人直接在提示词里描述运镜,结果画面空间感混乱。正确解法是先建立动线(沿哪个立面跑、在哪腾空、落点是哪个平面),把空间路径描述清楚,AI 生成的运动才会有连贯的空间逻辑。 但怎么把这种抽象的“导演思维”翻译成 AI 听得懂的语言?这就涉及到一个高频痛点:不同的 AI 模型,对空间和镜头语言的“理解性格”完全不同。以前为了试一组跑酷动线 Prompt,要在 Claude、GPT、DeepSeek 之间来回切平台,切到思路断线,月底对账单也头大。 最近把这个动线测试工作流接进了 ZenMux,在同一个界面里直接调度和交叉实测,发现很有意思:Claude 的空间解构和节点拆分极专业;GPT-4o 对材质和光影的细腻润色拿来就能用;而 DeepSeek 成本极低,适合批量跑盲盒初筛。全程在一个入口搞定,后台额度清晰,还有智能路由和延迟赔付。真正干活和做内容交付的人,要的就是这种多模型调度的“确定性”和工作流“韧性”。降本增效不只是换个便宜模型,而是像导演一样,把不同的任务精准派发给最合适的工具。

波妞PONYO

13,190 görüntüleme • 4 ay önce

最近我用了 Grok Bot 一段时间,这是我最近最喜欢的 Agent 产品之一。 原因甚至不是 Grok 有多聪明。 是它真的有一台自己的电脑。 AI Agent 的最终形态,其实就是给 AI 发一台电脑。 xAI 给 Grok Bot 配了一台持续存在的云电脑,里面有浏览器、文件系统和终端。登录状态、文件、浏览器 Session 都会留下来,你把电脑关了,它也可以继续干活。 听起来只是一个产品功能,实际用起来,我觉得它把 Agent 的体验往前推了一大截。 比如我每天都要刷 X。 以前让我用 AI 帮忙看 X,工作流通常是这样的: 我刷到一条东西,复制给 AI;AI 觉得有意思,我再去找原帖;再开几个链接;再把资料复制回来;让它查证;最后再让它帮我写。 AI 干了很多活,但真正操作互联网的那个人一直是我。 Grok Bot 让我第一次很自然地把这部分也扔掉了。 我直接在它那台电脑上把 X 登录好,然后告诉它去刷我的 timeline,看看今天大家在讨论什么,发现有意思的东西就点进去,把原帖、引用、相关讨论都看一遍,再去外面查资料,最后觉得值得写的,帮我整理成帖子。 它就真的去操作浏览器了。 网页没有 API 没关系,没有 MCP 也没关系。只要人能打开网页、登录、点击,它就有机会自己完成。xAI 自己对 Grok Bot 的定义其实也很明确,它可以登录并使用网站和 App,用 computer use 处理那些没有干净 API 的软件。 这才是 Agent 真正重要的一步。 过去一年大家一直在给 Agent 加工具,Search、Browser、Code、MCP、Connector… 工具越来越多,可我的体验经常还是我才是所有 Agent 背后那个最累的 Agent。 我同时开着好几个 AI。这个查资料,那个写代码,另一个做图,还有一个跑 Deep Research。 A 做完以后我复制给 B,B 做完以后再扔给 C。 名义上我有一支 AI 团队,实际上我是这支团队里专门负责复制粘贴、开网页和催进度的项目经理。 Grok Bot 有一个特别戳我的能力**,它甚至可以去操作另一个 Agent。** 我可以在它的浏览器里登录其他 AI 产品,然后告诉 Grok Bot 这个任务你去交给它。 等它跑完,把结果拿回来,然后继续完成后面的事情。 到这里整个关系就开始发生变化了。 以前是我管理五个 Agent。 现在我开始尝试只管理一个 Agent,然后让它去管理剩下几个。 而 Grok Bot 本身也支持多个 Bot 协作,它们可以互相发消息、传递上下文、交接任务,同时共享用户的云电脑、文件和登录状态。 我觉得这才是真正让我兴奋的地方。 过去我们把 Agent 想成一个会调用很多工具的模型。Grok Bot 给我的感觉,更像是第一次给 AI 分了一张办公桌。 电脑在那,账号在那,浏览器开着。有什么事情直接发消息给它,它自己去开网页、找东西、操作软件、叫别的 Agent 干活。 这和在聊天框下面再塞十个按钮,完全是两种产品感受。 只要 Agent 真正获得了电脑,它能接管的就不再是一两个 AI 功能,而是今天已经存在的整个软件世界。 几十年来所有软件,最终都默认一个前提是屏幕前坐着一个人。 现在这个人,第一次可以不是我了。

sleepy.md

21,551 görüntüleme • 27 gün önce

我去!image2和seedance2.0简直绝配 还记得在视频号上「流量上百万」靠流量日入过千的机器人变形视频吗 现在又有羊毛可以薅了 而且光变现就有两种方式,第一种直接发布这种视频,我能赚流量的钱 第二种,那通过这个视频会有很多的商家来找我给他们做,一单200,这个是我验证过的 而且获客也很简单,发两条在自己的视频号上就可以了,土老板很喜欢这个,做出来的视频样式就在下面 而且这个平台是「字节官方开白名单的平台」我一定要推荐一下! 就是之前我推GPT会员购买的GamsGo做出来的rita 真的一定要去试一下,链接我放下面了,而且这是我实际接到的第一个需求,后面还有一个需求,我下一条就马上写出来给你。真的AI赚钱很轻松 而且 Rita 不只是视频生成这一个功能,它一站式集成了 Seedance 2.0、Kling、Runway 这些视频模型,还有 Midjourney、Flux 、image2这些生图模型,Claude、GPT、Gemini 这些对话模型 一个平台搞定全部,不用在五六个工具之间反复横跳,效率真的不是提升一点 还有一点很实在:新人注册直接送 100 积分,Seedance 2.0 可以先体验再决定要不要付费 Mega 套餐 $11.99 一个月,1200 积分,算下来比官方便宜不少,试错成本低很多。 想试试的直接点这个链接,有什么问题直接评论区反馈给我!:

叫我阿杭

60,231 görüntüleme • 5 ay önce

我跑通了: Qwen3.8-Flash-Next 模型 111GB , 单显卡4090 48GB 125B 级的 MoE, 以前想本地跑,那是机房里好几张 A100 的事。 现在 : 一张 48GB 改装版 4090, 加 123GiB 普通内存,不光跑起来了,250K 长文读完一道没错, 还和 27B 打了场 300 题正面对测。 模型是阿里前天才放的 Qwen3.8-Flash-Next,Unsloth UD-Q4_K_XL 量化 , 四个分片 111.3GB。 它能塞进单卡, 秘密就一条 : MoE 每个 token 只激活约 6B。 我把 33GiB 权重放进显卡, 70.7GiB 扔给内存——其中 26.8GiB 是那张 51B 的 n-gram 表, 它每个 token 只查几行,放内存几乎白嫖。 速度: 短请求 28.5–30.3 tok/s 读了 32K 内容 : 24.1 tok/s 读满 250K : 14.04 tok/s 长任务是这么虐它的 : 一份 250K token 的合成长文 , 里面埋 17 个要检索、要计算的字段,读完全文、找出来、算对。它半小时读完,17/17 一道没错,整轮 34.8 分钟。 质量这关更有意思 : 300 道冻结同题(代码+困难推理) , 这个 111GB 的大家伙 247/300, 16.5GB 的 27B Q4 245/300 统计上打平(p=0.86)。但单题耗时, 只是Flash 平均慢 48%。 所以我的判断 : 日常任务留 27B, 快; Flash-Next 的更强的是长任务。 网上那个"24G 4090 跑出 21 tok/s"很多人在转。 我看了测法:他把上下文窗口设到了 250K——窗口只是个上限, 意思是"最多允许模型读这么多" ; 但他每轮真正让模型读的内容, 只有 28K 左右。 模型读得越多越慢,他的速度 21 tok/s 是"读了 28K"的速度, 我的 14.04tok/s 是读满 250,002 token 的速度。 窗口设很大不关键、真正往上下文放了多少, 是完全不一样的,短测试可以很快,长文测试才是速度关键!!! 对了, 这轮 MTP 没开——模型目录里没有 draft 文件; 社区 sidecar 试过一版, decode 反而掉八九成。也就是说,这个 14.04 tok/s 还有的涨。 惊喜的发现!我本来想自己动手写的思路,发现 GitHub 上已经有人做出来了(01554 的 llama.cpp fork,expert-tier 分支): 上游 llama.cpp 显存不够时,把 MoE 权重整层搬去内存。 但专家冷热天差地别——512 个专家, 常被路由命中的就那几百个。这个分支改成按专家放:热门专家住显存,按命中热度限速换入换出,冷门的睡内存。路由越偏科,赚得越多。 作者的卡是 96GB 的 RTX PRO 6000,他测小卡的办法挺取巧 : 跑个进程占死一块显存,把可用显存压到 32GB、48GB, 模拟不同预算: 32GB 可用 : 整层切 25 tok/s,热缓存 35-36,快 42% 48GB 可用 : 整层切 29,热缓存约 39,快 34% 48GB 这档, 显存预算和我这张 4090 刚好一样。 但他的卡是 Blackwell,带宽算力都不同 热缓存只加速 decode, prefill 绕开走老路; 分支还是 experimental, 早期有个读错权重的 bug, 8/27 已修,复现要用修完的 commit。 下一轮,就在这张 4090 上测试这个。

huangserva

12,387 görüntüleme • 1 ay önce