Загрузка видео...

Не удалось загрузить видео

На главную

无上限畅用 GPT-5.6-sol的办法 如果你还在用 5.5 的习惯跑 GPT-5.6(Sol),那你现在大概率天天触碰limit 5.6 是真强,但它有个副作用: 单条消息用量暴涨,高推理下一跳就是 5 小时上限的 15%。 Theo 实测了一套省额度、又不掉质量的用法, 按重要性给你捋一遍。 先说为什么会触顶。 5.6 把 5.5 那个"动不动停下来问你要权限"的毛病治好了, 但它会一路干下去,用量跟着翻翻。 很多人还拿 5.5 的习惯在跑,自然天天顶格。 OpenAI 这边也挺坏,Codex 里有些设计就是在推着你多用。 1、Ultra 尽量别碰。 新功能,特别烧额度,等 Theo 专门那期出来再说,现在就当它不存在。 2、Fast 模式关掉。 它提速 1.5 倍,消耗快 2.5 倍。5.6 本来跑得就久,瓶颈在工具调用和跑测试,不在推理速度,关掉体感几乎没差,用量掉一大截。 3、推理级别默认挂 High。 deep SWE 实测: Low 45% Medium 61%...

38,586 просмотров • 1 месяц назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

试了一下 OpenAI 新出的 Codex App,有些亮点 跟 Skills 的适配还是有点问题,模型的主要问题就是慢 OpenAI 给 Pro 和 Plus 用户的 Codex 额度在未来两个月内全部翻倍了 👇看一下详细的能力介绍: Skills 可视化管理 有一个专门的 Skills 列表界面,预置了一些官方 skills,也可以扫描你已经安装的 skills。注意这里只能扫描 NPX 安装的,本地创建的(比如在 Claude Code 里创建的)扫不出来。 还支持 Skills Creator 创建的 skills,可以直接在 APP 里用它去创建新 skills。 ------ 定时任务功能,这个挺实用的。 可以让 AI 定期执行某些任务,比如每周给你一个解决问题的报告,定期去解决某个项目的 PR 问题,或者定期 review 代码。 对于需要持续维护的项目来说,这个功能还是挺有价值的。 ------ Codex APP 现在支持计划模式了。 因为它跟 Codex CLI 共享后端,所以现在 Codex CLI 也同步支持计划模式了。这意味着 AI 会先规划任务步骤,让你确认后再执行。 ------ 用量显示的样式做得挺好的。 进度条、余量、使用情况都很清楚,一眼就能看到你还有多少额度。 还有 code review 的快捷方式,可以快速调用你的 skills。MCP 的添加也支持。 ====== 实测:用 video-wrapper skill 跑了一遍 我测试主要是让它跑了一个我最近做的 skill,可以一键给视频添加视频包装,比如卡片、花字、人物条、章节标题这些。 这个 skill 挺复杂的,所以很适合用来测试。 ------ 第一次运行的问题 可以工作,但第一次它选了 PIL 这个方案,比较差。 核心问题是什么?它跟你没有交互。 我的 skill 里边写清楚了:要先问用户要哪套方案,再给出包装方案让用户确认,用户确认了再开始包装。 但在 Codex 这里,明显没有交互。它就直接跑,把所有决定都自己做了,跑完就完了。出错了也不管,直接用降级方案。 ------ 修复后的效果 我让它修复以后,它倒是能修复。重新跑了一遍,效果也不错。 最终生成的视频包装效果还行: ▸ 左下角有人物卡片 ▸ 有花字 ▸ 有各种卡片和章节标题 ▸ 结论卡片也加上了 因为我们用前端代码约束了样式,所以它在样式上不会出什么错误。 ------ 体验总结 整个过程很不可控: ▸ 速度很慢 - Codex 本身速度就慢 ▸ 交互明显不够 - 你根本不知道进到哪个阶段了,也不知道它的方案是什么 ▸ 只管执行 - AI 一直在执行,不会停下来问你 可能是它不太适应 skills 规范,只是简单做了一下适配,没有 Claude Code 跟 skills 的适配那么好。

歸藏(guizang.ai)

30,595 просмотров • 6 месяцев назад

今天,把一件关于 AI 很底层的事,彻底想透了。 使用 AI 的最佳方式是以道御术,但前提是你得先以术入道。 就像黄仁勋说的——真正会用 AI 的人,都是极高认知的提问者,带着自己的认知去提问,让 AI 帮你叩开未知的边界,而不是让它替你思考。 这段话最近反复在我脑子里出现, 但我觉得他还少说了一句: 这个认知,到底从哪来? 首先肯定不是看几本书、刷几条推就能来的, 我觉得至少得是你自己上手干过、踩过坑、改过错,这个认知才能慢慢长出来, 这就是以术入道。 就像做菜,你得自己掌过勺,才知道一道菜真正的好坏在哪,AI 也一样,你得先用过、踩过坑、改过错,才能判断它给你的建议到底对不对。 我现在的判断是,AI 工具大概率会分成两条路。 一条是 agent 型,Claude Code、Codex、Hermes 那种,你给个目标它自己跑,你睡觉时它也跑,手机戳一戳继续跑,像一辆自动驾驶汽车。 另一条是 实习生型,典型代表是 Cursor, 每一步都要你判断:diff 改对了吗? 这个建议要不要采用?要不要切 MAX 模型重跑一次? 它有判断力,但没有自主决策权,你不在跟前盯着,它就停下来。 agent 是替你思考,实习生是和你一起思考,而只有后者,才是真正以术入道的过程。 agent 型工具的核心是省时间,你用它做事,实习生型工具的核心是磨判断力,你用它的过程,就是你长出自己那个道的过程。 但实习生型工具有个致命瓶颈——你不在跟前,它就停了。 自从被官方投喂 $10000 额度之后,我现在是个 Cursor 重度用户, 家里专门放了一台 Mac 跑 Cursor, 结果它就变成一个必须我在场才能用的稀缺资源。 直到最近朋友给我推了 UU 远程,网易做的,都免费两年了,而且没广告没会员,一开始我都有点不敢相信。 试了下发现真香,手机一打开就能接进家里那台 Mac,4K 144 帧,几乎感觉不到延迟, 看 Cursor 实时 diff、处理报错、切模型,跟坐电脑前没区别。 最让我惊喜的是,手机能直接开终端, 以前出门想登家里 Mac 跑命令行, 得 Tailscale 再 ssh 再 tmux,折腾半天, 还原生支持一个完整终端,跟敲 zsh 没区别, Cursor 跑一半要 git status、kill 进程、npm install, 手机抬手就办了,特别方便。 更新版本的时候我才发现,UU 远程刚好做到第二年, 周年庆重申不收费,继续打磨产品给大家免费用,还预告了几个新功能:安卓屏幕共享、小窗模式、精细化权限管理、文件夹共享、笔记本设备性能优化。 一个免费做了两年、还在持续往里砸功能的产品,我觉得是真有长期主义、想把产品做好的。 话说回来,AI 发展到这个阶段,我们真正需要的,我理解已经不是更厉害的 AI了,而是一种能让你随时和你的 AI 一起思考的连接方式。 目前看,Cursor和UU 远程这类体验和功能都做的非常丝滑极致的产品, 对我来说就是这个连接方式, 把我和家里那个顶级实习生之间的物理距离消除了, 让我能在任何地方,磨我自己的那个道。 毕竟 AI 工具的尽头,不是替我们做事,是把我们磨成那个,值得被它认真回答的提问者, 以上和大家共勉,一起在学习和使用AI的这条路上,达到以术入道,以道御术的境界。

AYi

695,078 просмотров • 2 месяцев назад

一周前我给 ClawdBot 充了 50 美金,然后就再没管过它。 今天一看,余额变成了 828 美元。 来,我跟你唠唠这事儿。 我一直挺关注自主代理这块的。不是那种新闻里炒得热火朝天的东西,而是真正在后台默默跑、自己拿主意的那些实在玩意儿。 ClawdBot 前段时间在 X 上火了一把,有人把它挂到交易所和预测市场里,7x24 小时自动交易,全程不用人管。 我瞅了几个教程,心里就琢磨:要不我也在 Polymarket 上试试? 周日晚上,媳妇哄孩子睡觉去了,我坐电脑前,花了大概 40 分钟把 ClawdBot 搭好。本地跑着,注册了个 Polymarket 账号,存了 50 美金,把 API 密钥给它了。 系统提示词我这么写的: “你手里就 50 美金,全在这儿了。只做短线,5 分钟和 15 分钟周期。不许上头。每笔最多押当前余额的 10%。要是连续亏三笔,就歇俩小时。每回操作都得记下来。” 敲完我就把笔记本合上了,说实话,转头就给忘了。 周三随手点进去看了一眼—— 余额 187 美金。 我第一反应是系统出 bug 了。打开日志一瞧,好家伙, 三天里 ClawdBot 做了 83 笔交易。胜率 68%,平均每笔挣 2.1% 左右。 但真正让我吃惊的不是这些数字,而是—— 它居然会根据一天里的不同时段自己变招。 夜里波动小,它就自动减仓,少操作几回; 早上亚洲时段活跃,它就追着动量进得更积极; 一到新闻出来的时候,它干脆停手,等着市场“消化”完再说。 没人教过它这些。全是它自己从数据里琢磨出来的。 我啥也没动,就让它接着跑。 今天是周五,再看—— 828 美元。 7 天,50 变 828,我一丁点都没插手。 这礼拜我算是看明白几件事: AI 代理不是什么“未来”。它们已经在干活了,就现在。 人不可能连着七天不睡觉,每五分钟盯一回盘。ClawdBot 能。 最难的压根不是搭这个机器人,最难的是管住自己别手贱,让它安安静静跑。 X 上一堆 ClawdBot 的教程,你们自己翻翻去,试试看。 2026 年,代理赚钱的速度会快到很多人根本反应不过来。 把这贴存好。六个月后再看,它就是个预言。 注册 Polymarket: 最快的跟单工具:

区块链行情研究

10,463 просмотров • 5 месяцев назад

很多人一聊到选哪条链?第一反应都是: 热度高不高?补贴多不多?生态有没有流量? 但今天听了 Talus 🐸 CEO Mike Hanono 和 The Rollup 的视频会议,我反而有种感觉:这不是在给 Sui 站台,更像是一场技术自白。 首先Talus 选 Sui,真的不是因为它现在火。而是因为 Talus 想做的这件事,在别的链上,很难跑得像样。先说清楚一点:Talus 要做的不是一个 AI 应用,也不是几个 bot、几个策略脚本。它想做的是——一个大规模、自主运行的代理网络:成千上万个代理同时运行、同时决策、同时交互。光是这个前提,就把底层链的门槛直接拉满。 为什么是 Sui?我听下来,核心其实就三点。 第一,并行执行。代理世界不是排队点菜,不是你先我后那种单线程逻辑。代理一多,如果底层还是串行执行,结果只有一个:越跑越卡,最后只能做 demo。Sui 的并行执行,本质上就是为“多主体同时操作” 这种系统准备的,这点和 Talus 的形态非常贴合。 第二,高吞吐量。代理不是偶尔动一下,而是持续、高频地产生状态变化。TPS 要是撑不住,所有“自主”“实时”都会变成慢动作回放。对 Talus 来说,吞吐量不是加分项,是能不能活下来的前提条件。 第三,移动端和安全模型。这一点很多人会忽略。未来代理不只在服务器、交易后台跑,它一定会越来越靠近用户。Sui 在账户模型和安全设计上,本身就更像现代应用,而不是早期 DeFi 那套「钱包就是一切」的逻辑。 所以当 gmike 说“我们一直都是 SUI Maxis”,我反而觉得这句话挺克制的。这不是情绪站队,而是工程师视角下的现实选择。至于多链?我自己的理解是:Talus 不是不懂多链,而是很清楚——在基础设施阶段,过早多链只会把复杂度放大。尤其是代理这种高度耦合、强调协同的系统,先把一个底层跑通、跑稳,比到处铺点重要得多。很多项目喜欢先讲“未来多链叙事”, 但真正做底层的人,往往会先问一句:现在这个系统在哪条链上能真正跑到规模?从这个角度看,Talus 的选择是理性的,也是偏长期的。不追热点,不抢流量,先把代理世界里最难的那一块解决掉。这种项目短期不一定最热,但一旦真跑起来,后面的持续热度,反而会非常高。 Kaito AI 🌊 #Yapping #MadewithMoss MOSS #Starboard Galxe River River4FUN 🐝

百里 🌊RIVER | MemeMax⚡️|🧠SENT

13,710 просмотров • 8 месяцев назад

OpenClaw/Clawdbot作者 Peter Steinberger 讲了一个让他顿悟的瞬间。 他给自己的clawdbot发了条语音消息,然后才反应过来:我根本没做语音功能啊。但"正在输入"的指示器亮了。十秒后,agent若无其事地回复了。 Peter问它:你怎么做到的? Agent的回答让他震住了:你发的消息只有一个文件链接,没有扩展名。我查了文件头,发现是Opus格式。用你Mac上的FFmpeg转成Wave。想用Whisper但没装,还报错了。不过我翻了翻发现你环境变量里有OpenAI的key,就用curl调了API拿到转写,然后回复你了。 这个故事的意义在于,这不是预设好的workflow,不是写好的代码,是agent在遇到一个从未见过的问题时,自己想办法把链路串起来。文件头分析、格式转换、找可用工具、翻环境变量、调第三方API,一气呵成。 Peter说了一句话我很认同:这些东西是该死的聪明、足智多谋的野兽,只要你真的赋予它们力量。 "if you actually give them the power"才是关键。大多数人还在用AI写个总结、改个文案,把它当高级搜索引擎用。但当你给它shell权限,给它访问你本地工具链的能力,它展现出的自主探索完成任务能力完全是另一个量级。 与此同时,行业里有一大批人在反方向努力。有人在绞尽脑汁省token,精心设计让AI 更少思考,生怕多花几分钱。还觉得模型做事太慢,自己来设计一些流程替代 AI 的思考探索,美其名曰加速。这种思路本质上是把一个足智多谋的野兽关进笼子里,然后抱怨它不够聪明。 更神奇的是,市面上95%的软件压根就不是为面向智能设计的。还是传统思路:产品经理写PRD,开发者把逻辑一条条写死在代码里,用户只能在预设的按钮和流程里点来点去。这些软件在AI时代就像是用打孔纸带写程序,技术上能用,但完全错过了这个时代真正的可能性。 --- 注,这段切片是我丢下一句话给 claude code 完成的下载切片添加字幕,只是提出要求,没有任何 Skills,没有告诉他怎么做。

kAI

171,400 просмотров • 6 месяцев назад

给大家带来 MiniMax-M3 实测! 本次测试包含了复杂前端, 后端 Agentic Coding, Agent 能力测试, 以及我的使用经验总结. 来看结论: 前端能力上, 可以完全适配 KCORES2026p2 的前端测试题目, 无论是空间理解, 建模精确度, 场景美学都十分在线, 其中我最满意的是美学部分, 它的颜色运用非常好. 不足的地方主要体现在复杂需求不能一次性写对(比如光追引擎), 需要迭代一下就可以了. 后端能力测试这次也是突飞猛进, 得分超过了 deepseek-v4-pro 和其他一众国产大模型, 略逊于 GPT-5.4-Pro(xhigh). Agent 能力上表现同样亮眼, 达成了榜单第二的接单量, 证明它的规划能力特别强。 下面是我在测试和实际使用中, 总结出来的 M3 使用经验, 供大家参考: 我的体感是 M3 特别喜欢推理, 它可以单次执行超长的推理. 在咱们的这些前端测试中, 它最长的输出甚至达到了我规定的 64k token上限, 所以, 不要上来就写一个超级复杂的 prompt 让它执行, 而是需要先把需求形成 plan, 然后让 agent 蜂群去执行, 这样才能得到理想的效果, 所以 M3 先天适合放在带 plan 模式的 Coding Agent 中使用. 如果把它嵌入到 Agent 框架中使用, 那么 prompt 编排就一定要做好, 不要一股脑把大量的 tool call 或者超大的 system prompt 丢给它. 还是需要下功夫好好编排一下的. 本次 M3 相比之前的 2.7 版本有了大幅度的提升, 模型偏好上来看, M3 是一个规划能力极强的模型, 所以特别适合用在一些规划性质的 Agent 框架中, 比如任务拆分, 日程管理, 流程设计等. 而本次暴露出来的不足则是执行过程中约束不够强, 比如 prompt 中设置的复杂规则, 一定要增加代码级别的 harness 闭环流程来进行约束, 而不能只靠模型本身来管理自己的行为. #minimaxm3 #minimax #agenticcoding #aiagent #harness

karminski-牙医

18,950 просмотров • 2 месяцев назад

ChatGPT 桌面端(原来的 Codex App)今天加入了语音控制,macOS 和 Windows 用户可以直接用嘴指挥 AI 干活了。 具体来说,你可以一边跟 ChatGPT 说话,一边让它操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务,全程不用打字。开着一个语音对话,同时管理多个后台 Agent(智能体),有点像一个人坐在那里口述指令,几个助手分头干活。 这个功能基于 GPT-Live,OpenAI 在 7 月 8 日刚上线的新一代语音模型。GPT-Live 最大的变化是全双工架构,也就是它能同时听你说话和给你回话,不用像以前那样等你说完、停顿、它再开口。遇到复杂问题,它会把推理任务丢给后台的 GPT-5.5 处理,自己继续跟你聊,不会卡住。 macOS 用户多了一个叫 Appshots 的功能:语音对话时,ChatGPT 可以直接看到你当前最前面的窗口,了解你在做什么,回答就更贴合上下文。比如你正在看一段代码,直接说“这个函数有什么问题”,它能看到屏幕内容来回答。Windows 用户暂时没有这个能力。 此外,iPhone 用户可以通过远程配对的方式,用 iOS 上的 ChatGPT 语音来操控桌面端的 Codex。等于你拿着手机在沙发上就能指挥电脑写代码。Android 支持还在路上。 今天全球同步推出,面向 Plus、Pro、Business、Edu 和 Enterprise 用户。免费用户暂不可用。

宝玉

88,048 просмотров • 29 дней назад

泪奔了!好感人,不争气的眼泪,它从口里流出来了 ⸻ 最近刷 AI 项目的时候,说实话有点疲了。 不是它们不厉害,恰恰相反——都太厉害了。 模型、参数、速度,一个比一个漂亮,但看多了情绪上真的没什么起伏。 Kindred Labs 是少数让我停下来想了一下的。 不是“哇好强”,而是突然冒出一个不太技术的问题: 如果 AI 真的要长期出现在生活里,它该怎么待着,才不让人别扭? 不是那种我问你、你马上答的关系, 而是你会不会哪天顺手再点开它。 有些 AI 真的很聪明,但你心里清楚,它就是工具。 用完、关掉,不会再想。 Kindred 给我的感觉不太像在争“最会答题”。 它更像是在琢磨一件事: 人为什么会愿意和一个存在长期相处? 这时候我才开始注意到他们说的那套 Mind / Body / Soul。 不是因为名字,而是方向。 Mind 这一层,其实挺像人。 不是一直保持同一种状态。 有时候你需要逻辑,有时候只是想被理解, 有时候甚至不需要答案,只要有人把话接住。 再加上它会记得你。 不是那种冷冰冰的“你在某年某月问过什么”, 而是你们之间发生过的那些事。 一旦记忆变成关系的一部分, 整个体验就不一样了。 Body 这点我以前真没太当回事。 但后来发现,人很难和一个完全无形的东西建立稳定关系。 Kindred 至少正视了这一点。 有形象、有存在的位置, 在你已经习惯的设备和场景里出现。 不是为了炫, 而是为了让你不抗拒。 在你信任之前,你首先得觉得它“正常”、不吓人。 至于 Soul,其实是我最看重的。 现在的 AI 都很会, 但很少有那种让人想一直留着的。 Kindred 没那么急。 不催你、不拉你、不用力制造黏性。 你来,它在;你走,也不打扰。 Dark Matter、任务、社区这些东西, 给我的感觉更像是一起走一段, 而不是被系统牵着跑。 所以后来我发现,这套 Mind / Body / Soul 看起来是在讲 AI, 但底层其实是在讲人。 我们怎么建立信任, 怎么产生依附, 怎么愿意长期和一个存在共处。 AI 只是载体。 被认真对待的,其实是人的感受。 如果说 2026 年还有哪个 AI 会一直留在我视野里, Kindred 大概会算一个。 不是因为它最强, 而是它没有急着证明自己。

董小姐 |预测世界杯就在Gate

43,660 просмотров • 7 месяцев назад

为什么说 StandX 是在为活人设计,而不是为流量设计? 在链上混久了,你会发现一个很荒诞的现象 大多数永续 DEX 其实并不关心你这个人。 在它们眼里,你只是一个钱包地址,带着一串成交量,贡献了一笔手续费,然后最好赶紧把仓位平了,好让它们去统计数据。 这种设计假设交易者是短视且流动的,导致的结果就是:热闹的时候大家都在卷返佣,一旦奖励断了,平台立马就变成了一座空城。 但我盯着 StandX 看了很久,发现它的底层逻辑完全反了过来。 它是在假设你会留下来,甚至假设你会把这里当成长期的交易主场。 首先,它解决了交易者的空窗期焦虑。 做交易的人都知道,最耗神的不是盯盘,而是当你没机会开仓时,资金在那儿干坐着,系统也把你当成隐形人。 StandX 引入 DUSD,大家都在聊收益,但我看到的是连续性。 你的保证金在不交易的时候,依然是有反馈、有价值的。 这意味着你不需要在 USDC 和各种池子之间反复折腾。 这种不需要反复决策的丝滑感,是老手最看重的,因为它极大降低了心理损耗。 其次,它对订单簿的坚持,其实是对专业性的某种笨拙守候。 说实话,现在做 AMM 或者合意模型更容易拉新,因为新手点一下就能成交。 但 StandX 坚持搞订单簿,甚至鼓励挂单和 Maker 行为,这其实是在筛选用户。 它想要的是那些会计算成本、会管理仓位、会预埋限价单的长期交易者。它不是在讨好所有人,它是在服务那群真正懂交易的人。 最让我感触的一点,是它的奖励机制。 很多平台的激励其实是在鼓励自杀——诱导你为了拿奖金去高频刷量,最后手续费亏得比奖励还多。 而 StandX 的逻辑更倾向于奖励耐心。它看重的是你的持仓、你的挂单质量、你留在系统里的时长。 这种设计释放了一个信号:你不需要在这里做那个打一枪就换地方的过客。 说到底,链上永续协议现在的瓶颈不是技术,而是留存。 如果一个协议默认用户只是路过,那它永远留不住人。 StandX 现在的低估,很大程度上是因为它在做一件慢事——它在尝试建立一套让交易者能长期待得住的结构。 它不一定是为那些最激进、最疯狂的投机者准备的,但如果你想在链上找一个能稳定管理仓位、能让资金产生持续价值的地方,StandX 的路子走得非常正。 #standx #KAITO

比克大魔王

32,203 просмотров • 7 месяцев назад

卧槽,答案终于揭晓了! 那个在open router上持续霸榜的神秘模型,是阿里推出的全新大模型“蚂蚁百灵”!今天我们来深度聊一聊这个模型。 用过AI来完成前端开发的朋友肯定懂: 要让AI做出想要的UI总是要找参考,再不然就是要依赖设计 skill 的帮助。 但这种界面一旦看多了,就会陷入审美疲劳。 原因在于不管你是对标UI还是使用skill,结果都是被限定在固有的生成范围内。 最近小灰测了新模型 Ling-2.6-1T (由蚂蚁集团 Ant Ling 开发),发现它刚好就能打破这个限制。 它生成的页面不仅审美极度在线,而且自带高质量的交互效果,做出来的东西终于不再是干巴巴的呆板网页了。 但用它有个必须要避开的坑:Ling 2.6 1T 默认是没有深度思考模式的。 它在计算资源分配上极其克制,如果你偷懒丢一句"给我写个好看的界面",那么它大概率会给你一个准确但极其敷衍的结果。(视频1) 那么怎么取巧使用它? 小灰分享一个能逼出它真实设计水平的实操工作流:把它当成主规划师,先拆解风格,再写代码。 跟它对话时,你可以直接下这种指令: 1. 强制思考:先别急着写代码!帮我分析这个产品的定位,明确它的视觉情绪、色彩规范和排版布局,把思路列出来。(比如明确告诉它你要包豪斯风格或者北欧风)。 2. 落地执行:等它把设计语言梳理清楚,你确认没问题了,再让它基于这套标准去生成具体的 TailwindCSS 样式和前端页面。 用这种先 Plan 后做的方式,出来的页面不仅美观,而且风格极其统一。(视频2) 目前在Openrouter中可以免费体验该模型。 选对工具打破模板限制,用高审美的模型直接拔高视觉质感,能帮我们省下大把死磕 CSS 的时间。 期待大家都能快速做出让人眼前一亮的作品!

程序员小灰

15,021 просмотров • 3 месяцев назад

在硅谷科技圈社交的觥筹交错之中,小龙虾之父🦞 Peter Steinberger 🦞 打开自己的电脑,分享了他和 Agent 一起工作的几个流程。 开篇他就提到: 去年,我受限于 token。 我通过加入 OpenAI 解决了这个问题。 后来,我受限于 CPU。 现在我感觉,真正限制我的其实是注意力。 他点出了我们与 AI 协作方式中正在发生的一个重要转变。 大多数人以为自己在使用 AI。 但实际上,他们还在做那些未来应该由 agent 接手的协调工作。 我把它整理成一个 7 层阶梯。看看你现在在哪一层。 第 1 层:聊天 你提问,它回答。其他事情还是你自己做。 第 2 层:上下文 你把背景信息贴进去,它的回答变好了。但你仍然要决定什么上下文重要,以及什么时候提供。 第 3 层:记忆 它开始记住你。你不用反复解释那么多。但你仍然在管理每一次会话。 第 4 层:工具 它可以搜索、读文件、运行代码。但你仍然要决定什么时候调用工具、为了什么调用工具,以及如何检查每一个结果。 第 5 层:技能skill 你已经给了它一些工作流程和 playbook。它知道你的工作方式,而不只是你问了什么。但它仍然是被动的,还在等你启动。 第 6 层:后台工作 它可以在你不盯着看的情况下运行,异步执行。你审核的是输出,而不是过程。 现在大多数关于 “agentic” 的炒作,其实都集中在这一层,而且大多数团队还没有真正达到。 第 7 层:目标 你定义结果、约束和品味。agent 负责跑完整个循环。你不再管理任务,而是管理方向。 每往上一层,你做的任务管理就更少,承担的结果 ownership 就更多。 这不只是工具能力的变化,而是你和工具、你和自己时间之间关系的根本变化。 大多数人还停留在第 2 层或第 3 层,却把这叫作“使用 AI”。 大多数团队还停留在第 4 层或第 5 层,却把这叫作“AI-powered”。 真正的突破,是建立一种更好的 delegation contract,把人从执行者释放出来,变成方向的定义者。 那么:你现在在哪一层呢?

Michael Guo

17,812 просмотров • 1 месяц назад

近日,老梁围绕“消费降级”话题发布视频 在视频中,老梁认为 一、“经济这几年不会好。消费降级是个持续的过程,一定要做好准备,不要抱有幻想。” 二、“不要以为消费降级是别人的事。我这么有才,我这么有本事,我这么有人脉,我这么有能力,消费降级轮不到我,我依然是谁会精英。” 他指出,“大时代的一粒尘沙,落到每个人都是一座大山。” 在谈及社会结构时,他表示:“在中国最可笑的就是中产阶级,中国的中产就是笑话,可能一夜返贫。你不行,你差的远。我们要正确的认识自己的能力,不要把自己想得太高。” 对于知识的作用,他提到:“有人说,我学那么多知识就没有用了吗?有用。你学那么多知识有用,让你知道,中产阶级脆弱的,是不可靠的。消费降级的时候你也是社会底层。学文化最大好处是清醒的认识到自己所处在哪个位置。” 他还表示:“不学知识就不行了,你就跟司马南的粉丝似的,你还以为你是这个国家的主人当家做主呢,你不是做梦呢么!” 关于人生与处世,他提出:“人一辈子有三件事:自己的事,别人的事和老天爷的事儿。自己的事儿别指望别人;别人的事儿别瞎管;老天爷的你得顺着它来。” 他总结称:“消费降级是国运,你得顺着它来。有钱的时候你讲究点,没钱的时候你就将就点吧。”

李老师不是你老师

290,278 просмотров • 4 месяцев назад

星爷讽刺了世间一切,唯独没有讽刺爱情,: 原来是如此的隐喻,到现在才明白,感谢星爷,只是我们弄脏了爱情。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。 懂你意思了,这版我会刻意留下不完美、主观判断和情绪停顿,像是你自己琢磨出来的,而不是“写给别人看的技术解读”。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。懂你意思了,这版我会刻意留下不完美、主观判断和情绪停顿,像是你自己琢磨出来的,而不是“写给别人看的技术解读”。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。#KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 |上Gate玩事件合约

36,252 просмотров • 8 месяцев назад