Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

GPT-6终于来了,OpenAI吹它是AGI降临。但我更关注三点: 1. 电脑操作能力很强,但长程编程未必反超Fable 5.1。 2. 审美和3D建模能力大涨,设计师们可能要瑟瑟发抖了。 3. 目前只限量开放给部分企业,咱们普通用户最近能薅的只有赛博义父Tibo的每日重置。 到底是不是AGI,还是等真用上再说。我的200美元Pro已经充好了,放出来我第一时间实测。

39,088 Aufrufe • vor 9 Tagen •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

用了两天的Fable-5,得到了一个与大部分人截然相反的结论,实测体验如下: 速度:非常慢,尤其是开始分析和规划的时候能感受到像乌龟慢爬 价格:我是Max5订阅用户,虽然输入输出定价为Opus的两倍,但是实际消耗量并没有像流水一样,消耗速度确实变快了,但命中缓存后消耗没有特别高,没有人传人的消耗那么离谱的快 所以铺天盖地说消耗非常快的只有三种可能: 第一种是Pro订阅账号容量本来就小, 第二种是没自己账号纯造谣, 第三种是本来对Opus的消耗没有感知,看到别人说fable消耗快自己也一用发现消耗快于是觉得是真的消耗快了。本身Opus的消耗就非常快嘛,现在只不过是变为了原来的大概1.5x 对于我来说,我通常只用Opus,所以这个1.x倍Opus的消耗量能够接受。实际使用中建议把缓存重建修改为1小时。 能力:能力强体现在思维边界更广,架构能力更强。 对于前端能力测试确实是有很大提高,尤其是创意能力。真正落地到工程项目中,我的体感是能够真正发现GPT-5.5的问题了,不会再像之前基本一直认为GPT的分析是对的。 实际能力类似于Claude Opus4.6++与GPT-5.5++的结合版,目前没有到非常惊艳的程度 结合价格和6月22之后就没了,我也没有升级Max20的打算,Max5+GPT-5.5乃至即将出现的5.6我觉得完全够用。也建议大家理性消费。如果想走按量体验可以看下评论区。 最后给大家看一下昨晚用Fable简单构建的前端的效果,关于为什么我吐槽过还要做前端,是因为我也需要在抖音小红书炸裂搞流量,人作为视觉动物,前端是最开始抓住注意力的开头的。 视频如下,网站部署在verel地址放在评论区了,大家可以自行查看

雪踏乌云

24,345 Aufrufe • vor 3 Monaten

从国产SOTA走向世界SOTA? GLM-5.1 实测! 给大家带来 GLM-5.1 编程能力实测! 本次测试涵盖了前端, 后端, Agent 能力, 前端主要面向空间建模, 场景, 材质, 粒子效果等, 后端能力主要面向数据结构与算法, 体系结构, 性能优化, 内存和并发管理, 性能热点分析与调优, 面向编辑器方向的Agent能力(因为AI要自己改代码). 直接说结论, 本次测试前端方面粒子效果和光影鲜果略有提升, 剩下空间理解(甚至感觉下降了)和前端美学上没看到有什么提升, 只能说是提升了一点点. 但是后端性能上有巨大的提升, GLM-5.1 在我的 vector-db-bench 中直接秀了一手量化, 把原本32bit精度的数据量化到了8bit, 然后使用SIMD实现了一个指令周期内计算32个向量, 在我测试的其他模型中(包括Claude-opus-4.6, GPT-5.4-Pro(xhigh)) 都没有实现, 直接来到了榜首. 另外Agent能力上也有不小的提升, 同样是我写的让大模型模拟送外卖的硅基骑手测试, 其他大模型的优化还停留在看一个店能不能取两单上, GLM-5.1 已经优化到了我送餐的顺路还能再接一单, 并且仅用了大概GLM-5 1/4的 token 用量就超越了 GLM-5 的测试总分. 当然本次测试过程也很坎坷, 首先是我周末抢了2天都没抢到 coding plan (目前只有coding plan 能用这个模型), 我最后找智谱的同学给我开了个权限. 以及测试中发现白天API不是很稳定, 偶尔输出速度会掉到10tps, 以及会出现乱码文字(我的规避方法是让它输出英文, 然后再找个便宜模型翻译过来). 总结, 各位前端同学估计会失望, 因为无论是从工程还是页面效果上都看不到提升, 甚至可能会有点倒退, 但果写后端代码或者复杂Agent应用可以试试这个新模型, 会有很大的提升. #GLM51 #智谱 #GLM #AIAgent #大模型编程

karminski-牙医

19,683 Aufrufe • vor 5 Monaten

哎呦妈呀 我到现在还没吃饭 没回家呢 最后我再打点儿文字 我就回家了 是这样 今天我打算CTO一个币 是呆着太无聊了 太没劲了 打算给自己找点儿事儿干 至于亏钱赚钱我也不在乎 然后我之前一直在BSC链上建设 之前714建设的时候更是百般煎熬 所以我在BSC上建设完714后 我再来SOL建设 我感觉就是降维打击 这个币 肯定是一会儿涨 一会儿跌 不可能一直涨 至于我呢 我首先觉得在当下BONK支持中国硬币 和大行情也不错 在加上这个IP本身 还有一大堆KOL都上车了 我是认为只要坚持那么几天 3天 5天就能看到成效 当然了 我肯定没钱做庄 我也没法拉盘 所以你们拉盘可别指着我 但是我不会说今天建设 明天跌了就不建设了 我肯定去认真建设这个币 因为呆着也是呆着 闲着也是闲着 玩儿呗 所以你们持有这个币的 要是感觉跌了不行 就快卖了 要是拿着呢 我说句实话 起码咱们也一起建设一段时间看看吧 这不是一天的事儿 包括庄家进场 游资进场 那都不是一天的事儿 然后用平和轻松的心态去建设 就说到这吧 反正这币一跌就不行 就得一直涨才行 这我可没那能耐 我根本控制不了涨跌 我只能说我会跟着持有的兄弟们一起努力 其他的就只能说尽人事听天命 但行好事莫问前程了 但是我觉得只要坚持 坚持那么3天5天应该就有回报 我是从714过来的 所以我能坚持 看好的就咱们大家一起努力吧 加油 希望明天早晨起来能有惊喜 说实话 我也怕明天起来几把归0了 但是什么结果我都能接受 你也要能接受 之前我建设714他们就老说我 说我应该一直打鸡血 不能说丧气话 但是我这个人主张说实话 那本来就是这么回事儿 我就实话实说 主要现在市值也太几把低了 这IP这么好 今天这么火 热度这么高 基本全网皆知了吧 而且叫得上名的KOL很多都进场了 但是进场的KOL我说一下啊 我只是带头建设 但是你们不能全靠我 必须大家齐心协力 一起努力才行 你不能买完币就等着 说实话 我能有多大能力啊 我只能起一个起点作用 中间要靠咱们大伙儿 我明天起来以后继续建设 其他人不困的或者精力旺盛的继续建设 这不是我一个人的事儿 是每一个KOL和每一个持仓者的事儿 我相信我们能把这个币给干成 晚安兄弟们

旧金山不是巴黎(Meme部部长)

78,094 Aufrufe • vor 1 Jahr

星爷讽刺了世间一切,唯独没有讽刺爱情,: 原来是如此的隐喻,到现在才明白,感谢星爷,只是我们弄脏了爱情。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。 懂你意思了,这版我会刻意留下不完美、主观判断和情绪停顿,像是你自己琢磨出来的,而不是“写给别人看的技术解读”。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。懂你意思了,这版我会刻意留下不完美、主观判断和情绪停顿,像是你自己琢磨出来的,而不是“写给别人看的技术解读”。 —— 我之前一直对 zkML 有点矛盾。 逻辑上它很美:模型是对的,而且你还能证明它是对的。 但每次真去看实现,基本都会卡在同一个地方——跑不起来。 不是“慢一点”,而是那种一看资源占用就知道不可能进生产的跑不起来。 模型稍微大点,电路直接失控,内存、时间全都爆表, 最后只能留在论文和 demo 里自嗨。 所以我第一次认真看 Inference Labs 的时候,关注点反而不在“zk”, 而在他们是不是愿意承认:这玩意本质是工程问题。 DSperse 给我的感觉,就是终于有人不再执念“一次性证明整个模型”。 模型切开、并行跑、只验证关键路径, 听起来很朴素,但恰恰是工程师会选的路。 不是最优雅,但能活。 JSTprove 则更现实。 你不需要懂零知识、也不用研究电路怎么写, 把 ONNX 模型丢进去,能转、能跑、能验, 这点其实比很多“性能提升 10%”更重要。 这两块拼在一起之后,zkML 才第一次让我觉得: 它不是在证明“我可以”, 而是在回答“你要不要真用”。 对我来说,zkML 的拐点从来不是密码学突破, 而是有没有人愿意为“跑得起来”妥协设计。 Inference Labs 看起来,至少选了这一边。#KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 |上Gate玩事件合约

36,252 Aufrufe • vor 9 Monaten

Ilya——塑造世界的人工智能科学家 如今,AI 是一项伟大的科技,因为 AI 将解决我们现在面临的所有问题。它能解决就业问题,能治疗疾病,能消除贫困,但同时它也会带来新的问题。假新闻将会愈演愈烈,网络攻击将变得更加严重,我们将面临全自动的 AI 武器的问题。我认为 AI 有潜力创造出无比稳定的独裁统治。 今天早晨,关于人工智能威力的警告再次响起,超过 1300 位科技产业领军人物、研究者及其他人士正呼吁暂停人工智能的发展,以便认真考虑其带来的风险。 扮演上帝,科学家们被指责这么做已经有一段时间了,但我们正在创造的东西确实与我们迄今为止创造的任何东西都截然不同。是的,我们绝对有能力创造出具有自我目标的全自主实体。而且,这些实体变得比人类聪明的时候,确保它们的目标与我们的目标保持一致将变得至关重要。 什么激励我?我喜欢思考根本问题,基本问题。我们的系统不能做什么,而人类却可以做到?我几乎以哲学的方式去思考这些问题。比如,什么是学习?什么是经验?什么是思考?大脑又是如何运作的呢? 我感觉技术就仿佛一种自然力量。在我看来,技术与生物进化之间有许多相似之处。生物进化的过程其实很容易理解,我们有基因的变异,自然选择的过程。我们保留那些有利于生存的变异,随着时间的推移,这个过程将使生物体变得极其复杂。我们不能因为理解了生物进化就能理解人体是如何运作的,但我们可以大概理解这个过程。 我认为目前的机器学习也处在类似的阶段,特别是深度学习,我们有一个非常简单的规则,它从数据中提取信息,并将这些信息输入到模型中,我们只需不断重复这个过程。这个过程的结果就是将数据的复杂性转化为模型的复杂性。因此,最终的模型会变得非常复杂,我们并不能完全了解它的运作机制,需要进行大量的研究,但实现这一切的算法其实很简单。 也许你听说过 ChatGPT,如果你还没听说过,那就做好准备。你可以把它看作是暴风雨来临之前的零星细雨。我们需要对此保持高度警觉,因为我认同这是一个意义重大的时刻。ChatGPT 被誉为颠覆性的创新,在许多方面,它确实做到了,比如在测试中得分超过人类。微软最近的一项研究得出结论,GPT4 是一个初级阶段的,但尚未完全形成的通用人工智能系统。 这就是通用人工智能。通用人工智能,这是一个可以胜任人类能做的任何工作或任务的计算机系统,而且可能做得更好。有可能在短时间内实现通用人工智能,也可能需要更长的时间。但我认为,由于通用人工智能可能在不久的将来出现,这个可能性足够大,我们应该给予它足够的重视。这一点至关重要要确保这些超级智能的系统能按照我们的最大利益去行动。 最初的通用人工智能可能就是大型数据中心,这些中心中充满了大量并行运行的专用神经网络处理器,紧凑、高热、能耗大,其消耗的能量可能相当于一千万个家庭的用电量。这些系统的智能程度可能会大幅提升,我相信它们将对社会产生深远影响。不过,人类真的会从中获益吗?谁会获益,谁又会付出代价呢? 首批通用人工智能的信念和欲望将极为重要,所以我们必须正确地编程这些系统。如果我们做不到这一点,那么就会出现这样的情况:进化的本质,即自然选择,将使这些系统优先考虑自己的生存。并不是说它们会主动对人类产生敌意,甚至想要伤害人类,但它们将变得过于强大。我认为,一个恰当的类比就是人类对待动物的方式。我们并不是憎恨动物,实际上人类往往对动物怀有深深的爱意,但当我们需要在两座城市之间修建高速公路时,我们并不会征求动物的意见,而只是因为这对我们来说非常重要而去做。我认为这也是我们与通用人工智能(AGI)之间的默认关系,那些能真正自主运作并为自己目标服务的 AGI。 许多机器学习领域的专家这些知识渊博和经验丰富的人士,对通用人工智能(AGI)抱有许多疑虑。他们对 AGI 可能出现的时间以及是否真的能够实现表示怀疑。目前,这还是一个鲜为人知的问题。用于神经网络和人工智能的计算机速度可能在未来几年内增加 10 万倍。如果多个团队处于竞相开发通用人工智能的军备竞赛态势中,他们就会没有足够的时间来确保他们构建的通用人工智能会真正关心人类。因为在我看来,这就像是通用人工智能发展的雪崩,一发不可收拾。 我认为将来整个地球的表面很可能布满太阳能板和数据中心。考虑到这些担忧,未来的通用人工智能的建设应该是多国间的合作项目。不论如何,人工智能的未来都将是美好的。如果这同样也能给人类带来福祉,那就更加理想了。 视频来源:

宝玉

45,172 Aufrufe • vor 2 Jahren

给大家带来 MiniMax-M3 实测! 本次测试包含了复杂前端, 后端 Agentic Coding, Agent 能力测试, 以及我的使用经验总结. 来看结论: 前端能力上, 可以完全适配 KCORES2026p2 的前端测试题目, 无论是空间理解, 建模精确度, 场景美学都十分在线, 其中我最满意的是美学部分, 它的颜色运用非常好. 不足的地方主要体现在复杂需求不能一次性写对(比如光追引擎), 需要迭代一下就可以了. 后端能力测试这次也是突飞猛进, 得分超过了 deepseek-v4-pro 和其他一众国产大模型, 略逊于 GPT-5.4-Pro(xhigh). Agent 能力上表现同样亮眼, 达成了榜单第二的接单量, 证明它的规划能力特别强。 下面是我在测试和实际使用中, 总结出来的 M3 使用经验, 供大家参考: 我的体感是 M3 特别喜欢推理, 它可以单次执行超长的推理. 在咱们的这些前端测试中, 它最长的输出甚至达到了我规定的 64k token上限, 所以, 不要上来就写一个超级复杂的 prompt 让它执行, 而是需要先把需求形成 plan, 然后让 agent 蜂群去执行, 这样才能得到理想的效果, 所以 M3 先天适合放在带 plan 模式的 Coding Agent 中使用. 如果把它嵌入到 Agent 框架中使用, 那么 prompt 编排就一定要做好, 不要一股脑把大量的 tool call 或者超大的 system prompt 丢给它. 还是需要下功夫好好编排一下的. 本次 M3 相比之前的 2.7 版本有了大幅度的提升, 模型偏好上来看, M3 是一个规划能力极强的模型, 所以特别适合用在一些规划性质的 Agent 框架中, 比如任务拆分, 日程管理, 流程设计等. 而本次暴露出来的不足则是执行过程中约束不够强, 比如 prompt 中设置的复杂规则, 一定要增加代码级别的 harness 闭环流程来进行约束, 而不能只靠模型本身来管理自己的行为. #minimaxm3 #minimax #agenticcoding #aiagent #harness

karminski-牙医

18,950 Aufrufe • vor 3 Monaten

小扎吐槽苹果和 Google,以及谈为什么开源 AI **Mark Zuckerberg**: 我认为移动生态系统中普遍存在的一个问题是有两个把持入口的公司,Apple 和 Google,它们可以告诉你可以构建什么。 在我们的历史中有很多次,比如有经济层面的情况,就是我们构建了些东西,然后它们就会拿走我们大部分的收入,但还有一种是质量层面,这实际上让我更加不满,也就是有很多次我们推出或希望推出某些功能,然后Apple就会说,不,你不能推出这功能。 这真的很糟糕。 问题是,这样的世界是否会在AI领域复现,就像你会有一小部分拥有封闭模型的公司,它们控制API,因此将能够告诉你可以构建什么。 我可以说,对我们来说,自己构建一个模型以避免处于那种位置是值得的。 我不希望那些其他公司告诉我们可以构建什么,而且我认为从开源的角度来看,很多开发人员也不希望那些公司告诉他们可以构建什么。这就是我坚定支持开源的原因之一,我认为未来AI的集中化可能像其广泛传播一样具有潜在危险。 我发现很多人都在思考,如果我们能实现这种技术,那么让它广泛传播是否不利。 我认为另一种可能也很糟糕的情况是,如果一个机构掌握了一种强大的AI远超其他所有人的,这同样是非常糟糕的。在我看来,一个理想的世界应该是这样的:AI技术被广泛而均衡地应用,随着时间推移逐步增强其健康性。在这样的世界里,各种系统能够相互制衡,这种平衡的状态比一个高度集中化的世界要健康得多。 虽然风险无处不在,但我觉得有一个风险我想人们我并没有听到太多人提及。 **Dwarkesh Patel**:举例来说,一个价值100亿美元的模型,如果经过评估是完全安全的,你们会选择开源吗? **Mark Zuckerberg**:我的答案是,只要这个模型对我们有所帮助,那我们就会开源。 **Dwarkesh Patel**: 那如果这个模型是用100亿美元的研发经费研发出来的,然后现在要开源呢? **Mark Zuckerberg**: 我们一直以来都有开源软件的传统,但是我们并不会开源我们的产品。 比如说,我们并不会将Instagram的代码开源,但我们会开源许多底层的基础设施。我们历史上最大的一个项目可能就是开放计算项目。在这个项目中,我们将我们所有的服务器的设计网络交换机和数据中心的设计开源了,这对我们来说非常有帮助。 因为很多人可以设计服务器,但现在,大家普遍都采用了我们的设计,这就意味着整个供应链都围绕我们的设计展开,规 模变大,对所有人来说都变得更便宜,为我们节省了数十亿美元。 这真是太棒了,对吧? 因此,我认为开源有多种方式可以对我们有所帮助。 一种就是,如果有人能够找出更便宜的运行模型的方法,我们将花费数十亿甚至上千亿美元,在所有这些模型上,所以如果我们能做的更有效率,那我们就可以节省数十亿甚至上百亿美元,这可能本身就非常有价值。 **Dwarkesh Patel**: 关于开源,我很想知道你是否认为像PyTorch、React、Open Compute这样的开源项目,对世界的影响是否已经超过了Meta在社交媒体方面的作用。 **Mark Zuckerberg**: 因为我曾经和使用这些服务的人交谈过,他们觉得这是有可能的,因为互联网的很大一部分都在运行这些项目。这是一个有趣的问题,我认为几乎有一半的世界人口都在使用我们的产品,这是一个真实的点,所以我觉得这很难超越。 但不管怎样,我还是认为开源是一种新的、非常強大的建设方式。 来源:

宝玉

74,721 Aufrufe • vor 2 Jahren