正在加载视频...

视频加载失败

OPENCODE 小技巧 #03: 探索代码小技巧 X 算法平台正好开源,打开 opencode 咱直接咨询 「我需要调研几个业务核心问题,请你帮我汇总最后输出一个报告,注意,每一个点都要找到代码级别的证据支撑,得精确到行号。 1. 点赞 vs. 回复 vs. 停留,谁更值钱? 2. “负反馈”的杀伤力有多大? 3. 发多了会被限流吗? 4. 做视频是不是有系统级优待。 请你帮我多开几个 explorer 进行调研」 这里有几个点需要注意 1. 「每一个点都要找到代码级别的证据支撑,得精确到行号」是为了防止 ai 出现幻觉为了押韵不择手段。 2. 「请你帮我多开几个 explorer 进行调研」是为了加速,默认官方的 free 模型并发可能会有限制,我建议大家使用 国产大模型 code plan 里面的 api key,比如我这里用的是 MiniMax (official) 的 key。 运行过程如视频(已加速) 结果在评论区。

12,655 次观看 • 6 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

最近使用 Kimi Code + K2.7 极速版辅助编码,分享一下使用体验。 背景: 来自大约 5w 行左右的 golang agent runtime 的重构。前期用 codex / cc 疯狂推代码之后进入了重构期。 用 codex / cc 压低代码行数,很难满足我想要的效果。比如 opus 4.8 反复背诵不知道从哪里学来的超过 300 行代码是不好的设计(我明明没有加这一条,记忆里面也没有),而超过 2000 行不能拆开的代码多了去了,这是本质复杂度。而 codex 在精简了一些之后反手又给我加了一些兼容代码。。。。 所以我回归了半自动的方案,用 kimi code 调研出报告,人工 review 之后开修,大致步骤如下 1. 选择一个切入点 /goal 请你使用 hai-architecture skill 帮我系统整理 nil, 按照当前代码,当前位置,问题点,解决方案表格罗列一下。 有些可能是 nil 本身过度防御,有的地方可能是设计上有更好的方向。请你系统梳理之后,整理到 docs/architecture/nil-review.md ,要详细,分好类和优先级,整 50个点给我 使用 /goal 是为了确保能捞 50 个点,使用 hai-architecture 是为了打开格局,看看是不是有些 nil 是不是因为更上层的设计问题。 2. 50个点的 markdown 看起来还是比较吃力的。可以做个简单的可视化优化一下咱们的阅读体验。 /skill:hai-visual-report docs/architecture/nil-review.md 做一下可视化 然后你就得到一个阅读体验比较好的问题清单,然后挑选一些问题开修就好了。 这里不得不吹一句,K2.7 极速版是真的快,两分钟可视化跑完(视频未加速),调研的时候没感觉有非常大的速度提升,到可视化报告这块速度很快,有明显的推背感。好处就是产出高了,坏处就是刷推少了。。。。。

海拉鲁编程客

18,291 次观看 • 1 个月前

我们必须彻底终结“政治庇护”这套玩法。 为什么? 因为你家的大门,不是为全世界的失败者敞开的。 有人说,我们得接纳他们啊! 我说不。 他们说,那这些人怎么办?他们会死的! 首先,这怎么就成了我的问题? 其次,地球上其他国家都消失了吗? 非洲的庇护申请者,为什么不去非洲国家? 阿拉伯人,为什么不去阿拉伯国家? 如果连文化最相近、血缘最亲密的国家都拒绝他们…… 那我们为什么要当这个冤大头? 打个比方。 想象一下,一个从几十公里外的小镇来的19岁小伙。 你从没见过他,不知道他是谁。 他没敲门,直接闯进你家,对着你大喊: “嘿!我饿了!给我吃的!” 他不是请求,是命令。 没有谦卑,只有索取。 你会怎么做? 你大概会拿出枪,指着他,让他滚出你的房子。 就算你愿意跟他多说一句,你第一个问题肯定是: “你为什么来我家?” “你为什么不去找你的邻居?” 他可能有两个回答。 第一种:“我问了,我所有的邻居都拒绝帮我。” 那你就要怀疑了。 所有认识你的人都不帮你,问题在谁? 是他们几百号人都是混蛋,还是你才是那个唯一的混蛋? 第二种:“我压根没问过我邻居,我直接就来找你了。” 这就更可疑了。 你为什么偏要跳过所有熟人,跑到一个完全不了解你的陌生人家里,提出要求? 所以,你只会关上门,告诉他: “两秒钟内,从我的地盘上滚出去,否则我就开枪了。” 一个四肢健全的成年男人,连饭都找不到,那是他自己的无能和懒惰。 那不是你的问题。 现在,把这个场景放大到一个国家。 完全一样。 一群又一群的陌生人,从天知道什么地方冒出来,要求我们帮助。 他们绕开了所有和他们文化、语言更接近的国家。 径直来到我们的边境。 这不值得怀疑吗? 但我们甚至不需要解释。 这是我们的国家,不是你的。离开。

墓碑科技

15,114 次观看 • 7 个月前

OpenAI 创始人 John Schulman 访谈节选:为什么 GPT-4 比一年前更“聪明”了?主要都是后训练(Post-Training)带来的! 另外他认为,在强化学习研究领域,研究人员需要具备丰富的经验和敏锐的直觉。了解整个技术堆栈,并对各个部分充满好奇心是关键。此外,从第一性原理出发思考问题,而不仅仅依靠实验证据,也能够帮助研究人员在数据操控和环境设置方面做出更好的决策。 *** Dwarkesh Patel:在未来,用于训练的计算力中,预训练与后训练的比例是否会明显偏向后训练呢? John Schulman:确实,有一些观点支持这种说法。 Dwarkesh Patel:我是说,现在这个比例非常不平衡。 John Schulman:但你可以认为,模型生成的输出质量比网上的大多数内容都要高。因此,让模型自己思考似乎更有道理,而不仅仅是训练来模仿网络上的内容。所以,我认为从第一性原理上来说,这是有说服力的。我会说,我们通过后训练取得了很多进步。因此,我不确定。所以,我希望我们会继续推动这种方法,并且可能会增加投入到后训练中的计算力。 Dwarkesh Patel:当前的 GPT-4 的 ELO 分数比最初发布的版本高出了大约 100 分。这是否全都是后训练带来的改进呢? John Schulman:对,我会说大部分都是后训练带来的。 Dwarkesh Patel:这很有意思。 John Schulman:因此,有很多不同的改进方向。我们会考虑数据质量,数据数量,进行更多的部署和收集新数据的迭代,改变你收集的注解种类。因此,有很多因素叠加在一起。但是全部加在一起,就会带来一个相当不错的,有效的计算力提升。 Dwarkesh Patel:后训练的优化程度对于竞争优势有多大影响呢? John Schulman:目前,我会区别公司是通过我们的模型有多大等等。那么,找出你之前提到的所有这些数据的复杂问题的公司,会占据大优势吗? John Schulman:我认为这确实是一个优势,因为这是一个非常复杂的任务。因此,你必须有很多有技能的人来执行它。因此,存在大量的隐性知识。同时也需要大量的组织知识。我认为后训练的过程,创建一个具备人们所关心的所有功能的模型,是十分复杂的。这需要付出大量的努力,它是大量研发工作的积累。我会说这种情况在某种程度上形成了一种壁垒,要想立即启动这种模型并非易事。 Dwarkesh Patel:看起来那些正在进行最严肃的预训练努力的公司,也在进行严肃的后训练努力。因此,看起来这种模型有可能被复制或有更多的类似努力出现。 John Schulman:另外,还有一种情况使得这个壁垒并非那么明显,那就是你可以提取模型,或者复制别人的模型输出,或者使用别人的模型进行比较。我认为大公司可能并不会这样做,因为这违反了服务条款,也会损害他们的自尊心,但我预计一些规模较小的参与者可能正在这样做以便更好地起步。 Dwarkesh Patel:那些真正擅长进行这种强化学习(RL)研究的人有什么样的特质呢?我听说这种研究非常具有挑战性,但是什么样的直觉能帮助你找到操控数据和设置环境的方法呢? John Schulman:我觉得有相当多的经验是关键。自从研究生时期以来,我一直在研究 RL 算法,涉及到数据收集、到注释过程,再到与语言模型的交互。所以,我算是涉猎了这些领域。我认为,在这类研究中表现出色的人通常对整个技术堆栈有全面的了解,并且对其中的各个部分充满好奇心。他们不仅依靠实验证据来更新自己的观点,还会从第一性原理出发思考问题。比如,假设深度学习是有效的,那么理想的收集数据的类型应该是什么,等等。

宝玉

57,175 次观看 • 2 年前

小扎吐槽苹果和 Google,以及谈为什么开源 AI **Mark Zuckerberg**: 我认为移动生态系统中普遍存在的一个问题是有两个把持入口的公司,Apple 和 Google,它们可以告诉你可以构建什么。 在我们的历史中有很多次,比如有经济层面的情况,就是我们构建了些东西,然后它们就会拿走我们大部分的收入,但还有一种是质量层面,这实际上让我更加不满,也就是有很多次我们推出或希望推出某些功能,然后Apple就会说,不,你不能推出这功能。 这真的很糟糕。 问题是,这样的世界是否会在AI领域复现,就像你会有一小部分拥有封闭模型的公司,它们控制API,因此将能够告诉你可以构建什么。 我可以说,对我们来说,自己构建一个模型以避免处于那种位置是值得的。 我不希望那些其他公司告诉我们可以构建什么,而且我认为从开源的角度来看,很多开发人员也不希望那些公司告诉他们可以构建什么。这就是我坚定支持开源的原因之一,我认为未来AI的集中化可能像其广泛传播一样具有潜在危险。 我发现很多人都在思考,如果我们能实现这种技术,那么让它广泛传播是否不利。 我认为另一种可能也很糟糕的情况是,如果一个机构掌握了一种强大的AI远超其他所有人的,这同样是非常糟糕的。在我看来,一个理想的世界应该是这样的:AI技术被广泛而均衡地应用,随着时间推移逐步增强其健康性。在这样的世界里,各种系统能够相互制衡,这种平衡的状态比一个高度集中化的世界要健康得多。 虽然风险无处不在,但我觉得有一个风险我想人们我并没有听到太多人提及。 **Dwarkesh Patel**:举例来说,一个价值100亿美元的模型,如果经过评估是完全安全的,你们会选择开源吗? **Mark Zuckerberg**:我的答案是,只要这个模型对我们有所帮助,那我们就会开源。 **Dwarkesh Patel**: 那如果这个模型是用100亿美元的研发经费研发出来的,然后现在要开源呢? **Mark Zuckerberg**: 我们一直以来都有开源软件的传统,但是我们并不会开源我们的产品。 比如说,我们并不会将Instagram的代码开源,但我们会开源许多底层的基础设施。我们历史上最大的一个项目可能就是开放计算项目。在这个项目中,我们将我们所有的服务器的设计网络交换机和数据中心的设计开源了,这对我们来说非常有帮助。 因为很多人可以设计服务器,但现在,大家普遍都采用了我们的设计,这就意味着整个供应链都围绕我们的设计展开,规 模变大,对所有人来说都变得更便宜,为我们节省了数十亿美元。 这真是太棒了,对吧? 因此,我认为开源有多种方式可以对我们有所帮助。 一种就是,如果有人能够找出更便宜的运行模型的方法,我们将花费数十亿甚至上千亿美元,在所有这些模型上,所以如果我们能做的更有效率,那我们就可以节省数十亿甚至上百亿美元,这可能本身就非常有价值。 **Dwarkesh Patel**: 关于开源,我很想知道你是否认为像PyTorch、React、Open Compute这样的开源项目,对世界的影响是否已经超过了Meta在社交媒体方面的作用。 **Mark Zuckerberg**: 因为我曾经和使用这些服务的人交谈过,他们觉得这是有可能的,因为互联网的很大一部分都在运行这些项目。这是一个有趣的问题,我认为几乎有一半的世界人口都在使用我们的产品,这是一个真实的点,所以我觉得这很难超越。 但不管怎样,我还是认为开源是一种新的、非常強大的建设方式。 来源:

宝玉

74,721 次观看 • 2 年前

做了个叫 Arkloop的东西,是个 Agent 客户端 开源,本地优先,简单优先 你可以把他想象成 claude desktop but open source, 并且带有自己的 taste 哦对了,另说一点,不是任何 agent sdk 套壳,也没有任何 base 任何 claudecode 行为,我一个人打磨了三个月 和市面上大部分产品不同 我花了很多时间在一个细节上 : 减少认知负担 一个例子 : 我平常只用一个模型聊天,那为什么每条消息前面都要告诉我用了什么模型?这是噪音 再举一个 : 开发者总是喜欢让 agent 的 tool use 完整的展示到前端,但是背后真正的用户体验逻辑是我需要知道 agent 在工作/在往哪个方向偏,所以我们并不需要如此详细的信息 设计哲学:认知负担,信息,价值导向,美学 换个话题 我一个人做 Arkloop 用了三个月,现在他能用了,但是它离完美很远 做产品很重要的一件事是…不要闭门造车,也就是我需要你们的真诚建议 引用来自 Arkloop readme 中的一句话 “我欢迎所有形式的贡献。即使你不是开发者,只是一个普通用户——如果你在使用中感到任何不舒服的地方,哪怕只是一点间距、一个颜色、一个很小很小的细节,或者是一个很大的方向,都可以直接开一个 issue。 我认真对待每一个体验细节,你的反馈会让所有人的体验变得更好。 如果你是开发者,Arkloop 的 Agent 核心、记忆系统、hook 机制都是开放的。你可以接自己的 provider、写自己的插件、甚至改掉你不喜欢的任何设计。” 这是我认为整个项目最精髓的一点,我希望看到你们的反馈,不管是细节还是方向 我在用 dify 的时候,我常常发现,一个特别小的间距问题,竟然在这么大的仓库里没人修 因此,我很重视这点理念 Arkloop 现在并不稳定,还有很多不完善的地方。希望大家多多包容,多提意见 另带一提,Arkloop 可以从 openclaw/hermes 导入配置 Github 仓库: Arkloop 官网兼下载: 关注我的推特: 加入 Arkloop 的 telegram 群组:

清凤

97,050 次观看 • 3 个月前

Claude Fable 5 重新开放了 最近刚好有一个demo,就是看能不能用顶级模型做一个meme工厂 “ 就是我输入一个 Meme Coin 创意 然后这个工具自动生成品牌 / 叙事 / 经济模型 / 营销方案 支持中文全流程输出,可以反复优化迭代 “ 也是想尝试一下,做一个可以验证 Fable 5 长任务能力 最终做出了一个能够简单跑的框架(我没有投入任何信息源,没有喂数据 所以跑起来效果没有那么屌,不过我觉得后期再投喂一些案例,我觉得确实是可以落地的) 说说我为什么用Fable 5 来测? 因为这个任务本质不是写代码 更像是说去测试AI的长链路规划能力测试 它需要: 1/ 语义理解 2/ 叙事能力 3/ 结构能力 4/ 一致性 5/ 自我检查 这刚好是 Claude Fable 5 主打的能力 整体跑下来我觉得还算是可以的,毕竟我这种不会写代码不会设计的小屌丝,确实在Fable 5 上面使用得其乐融融的 哈哈 再说说我的TOKEN使用量吧:112.31K(按照官方的收费标准大概是在:$4.2) 要是加上文本案例 再接入一个AI对话的API框架 我觉得应该费用还要再多出个大几十吧(个人猜测,毕竟投喂数据可能会比较烧tokens) 总的来说的话我个人还是觉得这笔消费还算挺值得的,因为这本身在传统行业的话 可能会是比较高的费用,AI真的弄挺好的 说完Claude Fable 5的体验, 那我不得不说我是在哪里体验的Claude Fable 5了 我这次没有走官方通道,而是走的是我之前给大家分享的中转站 Zenmux ZenMux 因为他这几天又搞活动了,只要你账号的余额>$0 你就可以免费体验Claude Fable 5 并且 Zenmux支持(不限于): 200+ 模型统一入口 无 RPM 限制 PK 模式 可以直接做横评 如果大家也想低成本体验一下 Claude Fable 5 我觉得当前使用Zenmux是最好的选择

车九

48,436 次观看 • 1 个月前

想认真做小红书个人号或者矩阵的朋友,这个 Skill 真的能帮你省掉 80% 的重复劳动。 看了我的 AI 工作流分享以后,很多宝子问有没有小红书自动化运营的工具,我GitHub上找了下,这个还不错, 说实话,我之前也以为所有小红书自动化工具都是垃圾, 要么用两天就封号,要么复杂到要写几百行代码,要么就是个只能发文字的残废,直到我试了这个, 最牛逼的是它的安全机制:完全不用小红书 API,全程用浏览器自动化模拟真人点击和输入。 第一次扫码登录后,后续所有操作都和你自己手动点一模一样,目前是我见过封号风险最低的方案。 而且它真的零代码,你不需要懂任何编程,只要对着 你的龙虾或者 hermes 说一句话就行: • 帮我分析一下我的首页推荐流 • 帮我生成五个今天能发的选题 • 帮我复刻这篇爆款笔记 • 帮我回复一下最新的评论 它全都能自己干完, 最狠的是它不只是一个单纯的发稿工具,它还有一个完整的运营闭环: 会分析你的账号数据、拆解别人爆款的结构、生成内容+封面、自动发布、自动回评, 还会把所有分析结果和操作自动存成 Markdown 知识库,方便你后续复盘。 安装也简单到离谱: 打开 Openclaw,直接说 “帮我安装这个 skill 就完事了。 仓库地址老规矩评论区自取鸭🦆

AYi

20,947 次观看 • 2 个月前

Vibe Coding 让每个人都有做软件的能力,我见过很多人做了几十个产品,纯特么自嗨,没有一毛钱盈利。 现在 AI 一晚上能做一个产品,代码成本趋近于零,成本低到大家觉得不需要验证,做完了自然有人用。 但事实上大家都在做“玩具”,因为 Vibe Coding 解决的是 how,但 what 和 why 被跳过了。 我最近一个多月一直在用 atypica.AI ,就是在写代码之前,先把想法丢进去跑一轮用户验证。 它会有一套完整的研究链路: 先帮你拆研究计划,然后从百万级真实用户数据构建的 AI 人设库里挑人,组成一个焦点小组(AI Panel),让这些虚拟用户讨论你的产品、互相辩论、给出反对意见。 并且,这个焦点小组可以反复用,每次你有新想法、新定价、新包装、新广告语,都可以拉同一批人再聊一轮。 我刚用它测过的场景: 上周我想做一个给老板用的 AI 助手,它帮我组了 12 个不同行业的老板人设(persona)并沉淀成我可以反复调用的Panel 。 30 分钟跑完,从报告中发现3件我完全没想到的事: 1. 当AI变得太懂老板反而会引发不安全感(尤其是很懂账目和客户关系时,会觉得被盯着); 2. 最抗拒 AI 的老板也不是完全不用 AI ,只是不想换工作方式(能继续发微信、拍照、说语音,后台自动整理); 3. 他们愿意为 AI 付钱不是因为功能多,而是因为它能帮自己少亏一次钱(少一次压货、客户流失或管理损耗,比“智能助手”这个概念更能打动人)。 根据这些发现我当场调整了方向,然后用panel里的同一批人再验证了一轮。两轮下来,避开了至少三个致命错误。 Vibe Coding 把做产品的门槛降到了零,但做对产品的门槛一点没变,如果你想要靠产品盈利,最好还是先想清楚: 你在解决真实需求,还是在解决自己幻想的问题。

余温

27,280 次观看 • 1 个月前

OpenAI刚刚开源的这个东西,感觉要把程序员的工作方式给整个改写了。 现在大家都在卷模型写代码有多强,但其实真正的瓶颈早就不是生成了。 一个人每天最多同时有效监督3-5个编码Agent,再多就会注意力崩溃,生产力直接归零。 有了Symphony,直接把这个上限干到了几十个。 它把你的Linear、GitHub Issues直接变成了永远在线的Agent调度器。 你开一个任务,它自动启动一个独立隔离的Codex Agent。 自己写代码,自己跑测试,自己做交叉Review,damn! 全部搞定之后,会给你提交一个完整的证据包。 CI全绿,安全和性能专项审查通过,改了UI就自动录好操作视频。 所有验证全过了,才会出现在你的Human Review队列里。 以后人类的角色可能会被彻底颠覆了。 以前你是监工,盯着Agent一步一步写代码,上下文切到吐。 现在你是老板,只需要看最终的结果。 满意就点合并,不满意就去仓库里补规则补文档补Guardrails。 记住兄弟们,永远不要手把手指挥Agent,永远不要替它干活。 这可不是啥实验室概念,OpenAI自己已经这么干了。 三个工程师,五个月,写了一百万行代码,0行人工写的。 产品已经有几百个内部用户,每天都在迭代。 我觉得他们最厉害的不是模型,是他们把整个仓库变成了Agent能看懂能自主工作的乐园。 现在很多人都搞错了Agent时代的核心竞争力。未来不是谁的模型更聪明,而是看谁能设计出让Agent可靠自主工作的环境。 我觉得未来最好的工程师,再也不是写代码最快的人,而是那些最会写规则,最会设计反馈回路,最会给Agent搭舞台的人。 现在Symphony已经开源了,它甚至不是一个成品。 是一个17k token的完整SPEC。 你把这个SPEC喂给任何一个编码Agent,十分钟就能生成你自己定制版的Symphony。 GitHub地址评论区自取👇

AYi

63,210 次观看 • 3 个月前

近日,老梁围绕“消费降级”话题发布视频 在视频中,老梁认为 一、“经济这几年不会好。消费降级是个持续的过程,一定要做好准备,不要抱有幻想。” 二、“不要以为消费降级是别人的事。我这么有才,我这么有本事,我这么有人脉,我这么有能力,消费降级轮不到我,我依然是谁会精英。” 他指出,“大时代的一粒尘沙,落到每个人都是一座大山。” 在谈及社会结构时,他表示:“在中国最可笑的就是中产阶级,中国的中产就是笑话,可能一夜返贫。你不行,你差的远。我们要正确的认识自己的能力,不要把自己想得太高。” 对于知识的作用,他提到:“有人说,我学那么多知识就没有用了吗?有用。你学那么多知识有用,让你知道,中产阶级脆弱的,是不可靠的。消费降级的时候你也是社会底层。学文化最大好处是清醒的认识到自己所处在哪个位置。” 他还表示:“不学知识就不行了,你就跟司马南的粉丝似的,你还以为你是这个国家的主人当家做主呢,你不是做梦呢么!” 关于人生与处世,他提出:“人一辈子有三件事:自己的事,别人的事和老天爷的事儿。自己的事儿别指望别人;别人的事儿别瞎管;老天爷的你得顺着它来。” 他总结称:“消费降级是国运,你得顺着它来。有钱的时候你讲究点,没钱的时候你就将就点吧。”

李老师不是你老师

290,168 次观看 • 4 个月前