正在加载视频...

视频加载失败

我第一次用 Ling 3.0 flash,做的只是一个很基础的任务,整理50条用户评论。 评论来自不同用户,内容很杂。有 bug 报告,有功能请求,也有对整体体验的评价。 过去处理这类材料,我得一条条读,再手动归类重复问题,统计出现频率,最后才能开始写汇总报告。这个过程不难,却很耗时间,也很容易漏掉信息。 ## 把重复劳动交给模型 这次我把全部反馈一次性发给 Ling 3.0 flash,同时给了它一套更清楚的处理流程。 它需要完成的事情包括。 - 对评论按主题分类。 - 提取每条反馈里的核心信息。 - 合并重复或高度相似的建议。 - 去掉无关和冗余内容。 - 输出一份可直接查看的汇总报告。 几分钟后,结果就出来了,结构很清楚,查看起来也很省力。 像记录问题,增加深色模式,一次性导出多条消息这类反复出现的建议,都被归到了一起。不同类别的反馈也完成了统计,哪些问题出现得更多,一眼就能看出来。 ## 模型负责产出,人负责判断 这件事帮我省下来的,不只是阅读五十条评论的时间。 我不需要反复检查有没有遗漏,也不用重新核算相似评论,更少了很多手动整理时容易发生的小错误。 模型没有替我决定产品该怎么做,它只是把杂乱的信息整理成了我能判断的材料。 产品要不要做深色模式,导出功能该排在什么优先级,bug 修复要投入多少资源,这些决定依然要由人来做。 我觉得这才是更接近真实工作场景的 AI 用法。人掌握目标,规则和最终决策,模型承担整理,归纳,格式化和生成这些执行工作。 ## 很多办公任务,不需要顶级推理 不少办公场景并不缺复杂思考,真正缺的是稳定完成重复任务的能力。 日常工作里,经常会遇到这些事情。 - 阅读一批文档。 - 汇总不同来源的材料。 - 统一格式。 - 按既定规则分类。...

14,330 次观看 • 20 天前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

Ling-3.0-flash :一个更适合实际工作的 AI 执行助手 过去一段时间,大模型的发展重点一直集中在能力提升上。模型能回答什么问题、能处理多复杂的任务,成为行业关注的焦点。但随着 AI 开始进入真实工作流程,用户对于模型的期待也在发生变化:除了能够提供高质量答案,更希望它能够稳定、高效地完成具体任务。 在日常工作中,真正消耗时间的往往不是复杂问题,而是大量重复性的处理工作。例如整理资料、分析数据、生成文档、处理代码、执行流程任务。这些事情需要投入大量精力,但其中有很多环节都可以通过 AI 进行优化。 Ling-3.0-flash 的定位正是在这一方向展开。它并不是单纯追求更大的模型规模,而是聚焦 Agent 工作流中的执行效率,帮助用户将明确的任务快速推进完成。官方介绍,该模型面向长程 Agent 工作流设计,重点提升响应速度、工具调用能力以及任务执行稳定性。 从实际体验来看,它最大的特点是能够很好地融入已有工作流程,让 AI 从一个问答工具变成一个真正参与任务执行的助手。 实测一:资料整理效率明显提升 第一个测试场景是长文档处理。 在实际工作中,经常会遇到需要快速阅读大量资料的情况,例如行业报告、会议记录、产品文档等。如果完全依靠人工整理,需要花费大量时间筛选重点、提取信息,再重新组织内容。 测试过程中,我将一批较长的资料交给 Ling-3.0-flash 处理,让它完成信息提取、重点归纳和结构化整理。 整个过程比较符合实际工作习惯。它能够快速抓取文档中的核心内容,并按照任务要求整理成更加清晰的结构。尤其是在面对大量相似信息时,它可以帮助用户减少重复阅读和手动整理的时间。 这类能力对于内容运营、产品分析、市场研究等岗位非常实用。很多时候,用户并不是需要 AI 替自己完成最终判断,而是希望它先完成信息整理,把大量基础工作处理好,让人可以把精力放在更重要的分析和决策上。 实测二:代码协作更加高效 第二个体验场景是代码辅助。 AI 编程已经成为大模型应用的重要方向,但真正影响开发效率的,不只是生成代码的速度,更重要的是能否持续参与开发过程。 在测试中,我让 Ling-3.0-flash 协助完成一个简单工具开发任务,包括生成基础代码、调整功能逻辑以及根据反馈进行优化。 我需要做一个AI 会议纪要整理助手,请帮我生成代码,把会议录音转文字或会议记录,自动生成:会议摘要、决策事项、待办任务、负责人、截止时间 首字耗时:337ms·完成耗时:68984ms·每秒 token 数:371 ,Ling-3.0-flash生成的会议纪要整理助手功能完整、专业美观,支持录音转文字、AI自动生成摘要/决策/待办任务,并支持导出和多种交互功能。 实际体验下来,它更适合成为开发过程中的协作助手。开发者可以先确定整体需求和功能方向,再让 AI 快速完成代码生成、修改和补充。这样一来,开发者不需要把大量时间花在重复编码和基础调整上,而可以更多关注产品逻辑和技术方案。 这种协作方式更接近真实开发场景。人负责判断方向,AI 负责提高执行效率。 实测三:批量任务处理展现执行优势 除了开发场景,批量信息处理也是 Ling-3.0-flash 比较适合的方向。 例如整理用户反馈、分析业务数据、处理文本分类等任务,通常具有数据量大、格式相对固定的特点。 在测试中,我模拟了用户反馈整理场景,让模型对大量文本进行分类,并提炼其中的主要问题。 从结果来看,它能够快速完成信息归类,并输出较为清晰的结构化结果。 这类任务的价值在于帮助用户减少大量机械操作。以前需要人工逐条查看和整理的信息,现在可以先由 AI 完成初步处理,再由人工进行确认和优化。 对于企业团队来说,这种能力可以应用在客服分析、市场调研、内部知识整理等多个环节。 速度和效率,是 Flash 模型的重要优势 随着 AI 应用逐渐深入业务流程,模型的效率同样成为重要指标。 很多实际任务并不需要每一次都进行复杂推理,而更需要快速响应和稳定执行。例如信息分类、内容整理、数据转换等工作,如果能够以更高效率完成,就能明显提升整体生产力。 Ling-3.0-flash 支持混合思考模式,可以根据任务复杂程度调整处理方式,在响应速度和任务能力之间进行平衡。 这种设计让它更适合高频使用场景。用户可以将更多日常任务交给 AI 处理,而不必担心流程效率受到影响。 从使用体验来看,它更像一个高效执行伙伴 经过几个场景测试后,Ling-3.0-flash 给我的整体感受是,它并不是单纯提升聊天体验,而是在帮助用户重新分配工作时间。 它可以处理大量信息整理工作,可以辅助开发过程,也可以参与自动化任务执行。 对于普通用户来说,它能够减少重复操作,提高工作效率。 对于开发者来说,它能够加快开发流程,降低基础工作的时间成本。 对于企业来说,它能够帮助更多业务流程实现自动化。 未来 AI 的价值,不只是回答问题,而是逐渐参与到真实工作流程中,帮助人完成更多具体任务。 Ling-3.0-flash 所体现的方向,就是让 AI 从一个提供答案的工具,进一步成为一个能够执行任务、提升效率的工作伙伴。 官推: 感兴趣可以自己试试 👉

冰糖雪梨

15,661 次观看 • 19 天前

蚂蚁百灵刚刚发布了 Ling-3.0-flash: 一个AI 执行层的关键拼图 刚刚看到 Ling-3.0-flash 正式发布,我觉得这款模型值得认真关注。原因很简单:在 AI 工程越来越深入到实际业务的今天,大家早就不满足于模型“会不会想”了,更关键的是它“能不能持续做”。 尤其是在 Agent 工作流中,需要高频调用工具、迭代代码、处理长程任务时,一个响应快、执行稳的执行引擎成了刚需。Ling-3.0-flash 的出现,正好瞄准了这个缺口。 1. Agent 的执行层 从我的角度看,它最聪明的一点是没有去硬拼超大模型的深度推理能力,而是把自己定位成一个高速执行引擎——负责把已经规划好的任务快速落地。 这在实际应用中特别实用,比如当大模型把方案设计好之后,剩下的代码生成、工具调用、批量处理就需要一个既快又稳的模型来接手。 2. 为什么它能兼顾速度和成本 技术细节上,它采用 124B 参数的 MoE 架构,但实际激活参数约 5.1B,在推理速度和运行成本之间找平衡。 它还支持混合推理模式:简单任务可以关闭 Reasoning,降低延迟,适合大批量处理;复杂任务则可以开启思考模式,保持逻辑连贯。 原生支持 256K 上下文,对需要持续读取历史指令和项目状态的 Agent 工作流也很重要。 3.如何使用 我觉得 Ling-3.0-flash 最适合做 Agent 工作流里的执行节点。反复调用 API 或 MCP 工具时,它能根据结构化错误信息自我诊断和修复,不容易在循环调试中卡死,因此适合放进 Loop 或 Graph 架构。 4.结对编程和批量任务 结对编程是一个典型场景:人负责架构规划、边界定义和测试,Ling-3.0-flash 负责快速生成代码、调用工具、读取报错,并根据反馈持续修改。 批量处理长文档、日志、简历和结构化数据时,它看重的也是速度、格式稳定性和成本控制。直播数字人或高频办公协作,则需要它的低延迟响应来减少体验断层。 5.边界 当然,它不是万能模型。复杂系统不能只靠一句指令搞定;缺乏架构和测试环境时,结果可能跑偏;需要深度冷门知识的研究任务,还是更适合交给更大规模的推理模型。 更合理的用法是:大模型负责搜索、规划和架构设计,把方案写成规范文档;Ling-3.0-flash 负责高频工具调用、代码执行和批量处理。 总结:Ling-3.0-flash 不是来替代所有模型的,而是把 Agent 工作流里“执行层”这件事做得更快、更稳。大模型负责想清楚,它负责做出来。

奶牛叔

65,993 次观看 • 21 天前

这两年我一直有个默认假设:模型参数越大,能力越强,什么任务都该交给最大的那个模型去做。但最近我在搭一个需要长流程、反复调用工具的 Agent 任务时,专门试了试把"规划"和"执行"拆开、交给不同模型来做的思路,用的执行端模型是Ant Ling刚发布的 Ling-3.0-flash。这次体验让我对"大模型不是越大越好"这句话有了更具体的理解。 我遇到的问题 起因是我想搭一个 Blender MCP 的工作流:让 AI 帮我自动完成一个简单场景的粗模搭建和运镜——比如摆几把椅子、设置一个摄像机轨迹,作为后续正式渲染前的预演草稿。 一开始我图省事,直接让一个参数量很大的全能模型来处理整个流程:既要它想清楚场景该怎么布局、镜头该怎么运动,又要它高频地调用 Blender 的 MCP 接口去逐步执行动作。 结果是,虽然效果还行,但每一步操作等待的时间都不短,跑完一整套流程花的时间和成本都超出了我的预期——毕竟这类任务里,真正需要"深度思考"的部分只占很小一块,绝大多数时间都花在了"调用接口、摆放物体"这类重复动作上。 换成"规划-执行分离"之后 我把流程拆成了两段:先用一个知识面更广的大模型,把场景的整体构图、镜头运动路径想清楚,写成一份结构化的操作说明;然后把这份说明交给 Ling-3.0-flash,让它作为执行引擎,逐条读取说明并调用 Blender MCP 接口去落地。 这一次的差别很明显。Ling-3.0-flash 的总参数量是 124B,但实际推理时只激活 5.1B 参数,加上首字延迟能做到 500 毫秒以内,我能感觉到每一步操作的响应几乎是"秒回"的——不再是那种等大模型"想"完再动手的节奏,而是我一条指令下去,场景里的物体几乎立刻就摆好了。整套流程跑下来,成本也比全用大模型的方案低了不少。 我的体会 这次尝试让我确认了一件事:如果任务里"想清楚该怎么做"和"把已经想清楚的事情执行出来"这两部分能拆开,那把执行这一段交给 Ling-3.0-flash 这类专门优化过工具调用稳定性和响应速度的模型,确实比一个模型包办到底更划算。 但我也发现,这套分工不是无脑套用的——如果场景本身很复杂,需要边搭建边做美学判断(比如构图是否好看、光影是否协调),单靠 Ling-3.0-flash 自己去决定,效果就会打折扣,这部分还是得靠前期规划阶段先想清楚。 人负责把边界和验收标准定好,大模型负责规划,Ling-3.0-flash 负责又快又稳地把方案落地——这套组合让我第一次比较直观地感受到"规划-执行分离"这套架构的实际好处。 目前Ling-3.0-flash 现已在 OpenRouter 上线——并可免费使用至 2026 年 8 月 3 日。 链接: 也可以直接网页对话体验: 大家不妨去体验体验一下,感受下魅力

韭菜饼子

83,352 次观看 • 20 天前

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,585 次观看 • 4 个月前

自从马云重新现身后, 蚂蚁集团一直猛冲AI,大动作不断! 像是卯足劲在追赶阿里QWEN! 最近更是连发两款实用拉满的模型!!! 先是百B级的 Ling 2.6 Flash, 盲测阶段就冲上 OpenRouter 趋势榜第一, 直接火到了海外!! 还不算完,Ant Ling 今天又甩出一张底牌: Ling 2.6 1T ! 名字就能看得出来,这个模型能力会更强!! 但有一个误区:能力强的不一定是思考模型! Ling 2.6 1T 不靠拉长推理链条来显得"很聪明", 而是把 token 更多花在理解、规划和输出上。 换句话来说: 它的核心定位,是面向复杂任务,是精准指令下的执行模型!! 1M 超长上下文,能把会议纪要、群聊记录、项目文档、零散资料一次性扔进去统一处理。 强工具调用能力,可以接进 OpenClaw、Hermes、LangGraph、Dify 等跑工作流。 真实问题处理,不只生成漂亮 demo,而是能够读懂已有代码,按照你的要求去干活。 Token 效率更高,不默认展开超长思考,成本控制到最低。 最近一段时间都是免费用,不用白不用, 我拿了几个真实任务跑了一遍,感受超级明显—— 如果是模糊的指令,它可能不太适合。 但如果是比较详细的指令,给它一个工作流, 就完全起飞了!! 没有了推理过程,感觉非常丝滑, 这一点,就挺重要的!! 减少了很多“AI自作聪明”的麻烦!! 说回蚂蚁这两款模型, 完全是冲着落地应用来的,几乎把简单和复杂的应用场景全部包圆。 1T 负责理解复杂目标、拆解任务、整理材料、制定计划。 Flash 负责快速执行、快速改写、快速补全。 这精准切入了现在大多数人用AI的“痒点”: 总想着用一个“最强模型”解决所有的事情。 但我认为真正重要并且正确的是: 让对的模型干对的事。 这样无论是速度、成本、还是结果一致性,都更能符合预期。

沐阳

116,421 次观看 • 3 个月前

Claude Opus 4.8 出了之后,我的第一反应是:想试。 第二反应是:算了,token 这东西真的不经烧。 结果看到 ZenMux 现在可以体验 Opus 4.8,就拿它试了一个我最近一直想做的小东西。 我自己有个很真实的问题: 脑子里经常冒出各种产品想法。 但每次真要开始做,就会卡住。 用户是谁? 第一版到底做什么? 哪些功能应该先砍掉? 怎么定价? 第一周从哪一步开始? 上线后怎么找第一批用户? 想法很多,执行很散。 所以我让 Claude Opus 4.8 做了一个「一人公司作战室」。 需求我写得也挺直接: 输入一句产品 idea。 自动拆出产品定位、MVP、开发任务、定价方案。 再生成落地页文案、冷启动实验、风险清单和本周计划。 最好不是一个静态页面,而是真的能点、能改、能导出。 然后我就把这段话丢给 Claude Opus 4.8。 出来的效果比我预期好不少。 它真的把“一人公司怎么从想法走到执行”这件事拆开了。 左边输入产品想法。 中间生成产品蓝图、MVP 范围、定价和官网文案。 右边是任务看板和本周计划。 底部还有冷启动实验、风险雷达和 Markdown 导出。 最让我觉得有意思的是,它不是一味堆功能。 比如我输入“给小红书博主做 AI 选题助手”,它会主动判断: 第一版必须做什么。 哪些功能看起来高级,但现在应该先别碰。 怎么找第一批真实用户。 哪些风险可能让这个项目做不下去。 这点就很能体现 Opus 4.8 的能力。 普通模型经常是:你要什么,我全给你加上。 最后页面很热闹,但产品判断是空的。 Opus 4.8 更像是在帮你收敛:先想清楚用户、场景和第一步,再把它变成可以执行的工作台。 我是在 ZenMux 上试的。 它比较方便的一点是,一个 Key 就能切不同模型,新模型上线也很快。 Opus 4.8 拿来做这种带产品判断、交互状态和复杂信息结构的网页,确实挺顺。 想试 Claude Opus 4.8 的,可以从这里进:

Joruno

15,983 次观看 • 2 个月前

昨天用 DAPPOS 的 xBubble Coding 搭了个小工具,专门盯头部账号互动和事件市场信号。 起因很简单。我刷到某个头部交易所创始人,回复了一条内容账号的推文,底下还顺手点了个赞。 我切到相关代币的 K 线看了一眼,市值直接拉了几千万!这种机会如果只靠人一直刷推,很难卡到前面的位置。尤其是链上 meme,很多注意力信号本来就不是从公告开始的。 可能是头部账号的一次点赞。也许是交易所创始人的一次回复。或者是项目方和 KOL 之间的一次互动。 我当时就在想,这种信号如果能自动抓下来,再接一层策略判断,自动买入,那岂不是能赚麻了!比别人先看到消息,然后提前卖出获利 刚好最近看到 xBubble 官方演示里有一个 Polymarket 事件检测和交易辅助案例,思路跟这个很像不是让人手动盯每条信息,而是把事件、信号、价格、市场变化串成一条流程。 我就顺着这个方向,用 xBubble Coding 搭了一套 Web3 交易信号工具。 测试版本: 流程大概是这样:推特那边一出现新互动信号,系统先自动抓下来,抓完之后,先过一层策略匹配,只有命中我设定的规则,才继续往下走。然后查一遍白名单库,筛出我真正关注的资产。再查一次钱包缓存,看有没有相关地址和历史行为。接着生成一份代币价格简报。 如果是 Polymarket 这类事件市场,还会同步整理事件状态、赔率变化、相关信息源和潜在交易方向。最后把符合条件的内容,提交到预设链上流程里。 这就是“追头部账号”和“追事件市场”真正能产生的结果。是把一个轻互动信号,变成一套可以执行的交易观察链路。 以前我是刷到相关信号之后,再手动去查币、看价格、翻钱包、看链上数据。那时候已经到接盘的时间了。现在是信号自己进入流程,系统帮我先完成筛选、整理和下一步动作。 这个变化很关键。因为 xBubble Coding 真正有价值的地方,不是帮我生成一段代码,而是把一个具体场景封装成一条端到端的业务 SOP。 我这次做的,其实更像是一套小型 Web3 交易信息服务。前端是头部账号互动监控和事件市场检测。中间是策略匹配、资产筛选和信息源整理。后面接价格简报、钱包缓存、赔率变化和链上流程。 这条链路跑通之后,它就不只是一个工具,而是一个可以持续迭代的个人信息优势系统。 这也是我理解 xBubble 商业价值的地方。它卖的不是代码本身,而是端到端的业务服务。 对小团队和个人来说,真正卡住人的往往不是“能不能生成一个页面”,而是能不能把内容、数据、流程、支付、执行和后续修改串成一个闭环。 xBubble 的 SOP 系统,核心就是把这个门槛压低。你可以用它做世界杯周边商城,把商品页、素材、收款和订单流程快速串起来。也可以做交规学习产品,把内容流量和私域转化接起来。也可以做本地服务入口,让用户看服务、提交需求、完成支付。 也可以像我这样,做一个 Web3 事件检测、头部账号信号追踪、Polymarket 交易辅助工具。 这些需求都有一个共同点很垂直,很细分,很贴近真实生意。它们不一定需要一个庞大的技术团队,但需要一套能快速上线、持续修改、直接承接收入的执行流程。 这正是 xBubble 适合 OPC 的地方。 一个人或者一个小团队,只要知道自己要服务谁、抓什么信号、卖什么产品、怎么完成交付,就可以用 SOP 把业务搭起来。 更重要的是,xBubble 不是只有固定模板。成熟场景可以直接用现成 SOP 快速启动,新的细分需求则可以通过 Bubble Engine 继续生成更贴合场景的专用 SOP。 这点对 Web3 特别重要。因为这里的机会变化很快。今天可能是头部账号互动。明天可能是 Polymarket 事件变化。后天可能是某个钱包行为。下一轮又可能变成社区积分、空投任务、链上数据面板。 如果工具只能做一种固定场景,空间会很有限。但如果 SOP 可以跟着新场景继续生成,个人和小团队就能把自己的细分判断,不断沉淀成新的业务流程。 我这次搭头部账号和 Polymarket 事件监控,就是一个很小但很具体的例子。它把我平时刷推、盯盘、查币、看钱包、看事件赔率的动作,变成了一条可以自动跑的流程。 以后我想加新的账号源,可以继续扩展。想换策略匹配规则,可以继续调整。想把简报字段做细,也可以继续改。想接更多链上动作,也能继续往后接。 这才是 OPC 时代 AI 工具真正该有的样子。不是让个人去模仿大公司搭团队,而是让个人用 SOP 获得接近专业团队的执行能力。 内容自动生成、多平台宣发、稳定币结算、链上任务执行、客户承接、后台管理,这些原本需要多人协作的环节,被压缩进一套更轻的业务系统里。 所以我现在看 xBubble Coding,已经不只是把它当成 AI Coding 工具。它更像是给个人创业者和小团队准备的业务启动基础设施。 对我来说,头部账号互动不再只是一个我刷到之后才处理的信息点。Polymarket 事件变化也不再只是一个我想起来才去看的页面。它们都可以变成自动进入系统、自动筛选、自动整理、自动触发后续流程的策略输入。这类细分需求过去很少有人专门做,因为太个人化、太垂直、变化也快。 但 xBubble 的 SOP 思路,刚好适合把这种需求做成可以低成本验证、持续迭代、甚至沉淀成服务的东西。这可能就是它最值得看的地方。AI Coding 的上半场,是让更多人可以做出应用。 xBubble 想做的下半场,是让这些应用真正变成能跑业务、能接收入、能持续迭代的商业流程。对 OPC 来说,这比一个好看的 Demo 重要得多。

币圈荒木|Araki🪵

30,150 次观看 • 1 个月前

我用掉 100 亿 Token 后,最大的变化不是更会写 Prompt。 而是 Codex 已经从一个聊天框,慢慢变成了我的: - 自我认识系统 - 工作系统 - 信息系统 - 学习系统 - 甚至是桌面陪伴系统 我把自己最常用的 20 个技巧整理出来了。 如果你也想把 AI 从“偶尔问一句”变成真正能长期协作的伙伴,建议先收藏。 一、让 Codex 逐渐认识你 1. 每天让它问你一个问题 我设了一个自动化:每天问我一个能帮助它更了解我、也帮助我认识自己的问题。它会避开已经问过的话题,围绕一个主题慢慢聊。 2. 把对话当成自我观察 现在可以直接语音聊。长期积累下来,它能看到我的情绪、偏好、反复出现的困扰和思考方式。 3. 让它把“它眼中的你”画出来 把你们的对话和一张漫画参考图交给它,让它生成多格漫画。你会发现:很多时候我们要的不是答案,而是被理解。 二、把 Codex 变成工作系统 4. 每周做一次 Codex 使用复盘 让它回顾这周我怎么使用它、哪些沟通方式有效、哪些任务返工了、哪些项目该继续推进。 5. 把失败经验写进“第二大脑” 不只是存笔记。把失败原因、偏好、最近关注点沉淀下来,让以后不同 Agent 都能调用同一份上下文。 6. 创意任务先开 Plan Mode 创意型工作最容易“没想清楚就批量执行,最后返工”。先用计划模式讨论目标、方案、数据体系和风险,再开始做。 7. 把 Codex 当思考顾问,而不是执行员 你甚至不需要有明确答案。只要说“我想做什么”,让它帮你一起把模糊的想法拆成可执行路径。 8. 需求清楚后切到 Goal Mode 需求确认后,把结果设成目标,让它自己持续推进。我的任务最长跑过 10 小时 44 分钟。 9. 用自动化处理重复但重要的事 日报、周报、账号监控、邮箱监控、回复策略、内容归档、同步到个人网站——这些都适合交给自动化。 10. 明确任务就开多 Agent 对于翻译、多语言网站、图片生成、资料整理这类边界清晰的工作,让多个 Agent 分工并行,比一个人盯着快得多。 三、让 Codex 跨出聊天框 11. 用 Sites 一键分享作品 做好网站后,不要卡在“怎么部署”。Sites 可以直接把成品变成能分享的站点。 12. 把插件当成能力扩展包 Computer Use、数据分析、Investment Banking、GitHub、Outlook / Gmail……很多工作不是“AI 会不会”,而是你有没有给它接上正确的能力。 13. 把生图能力接进日常工作 我已经用它生成了 300 多张图。做内容、配图、产品原型和视觉探索,速度会完全不一样。 14. 接入飞书,让手机也能操控 Codex 真正高频的协作不该只发生在电脑前。把它接到飞书后,我在手机上也能下任务、收结果、继续对话。 15. 用 ChatCut 把剪视频变成工作流 不是只让 AI 帮忙剪一刀,而是把素材整理、脚本、配图、剪辑一起接进创作链路。 四、建立自己的信息雷达 16. 每天订阅 Builder 信息 我会用 Follow Builders Skill 定时追踪 Builder 的新想法、新产品和讨论,再把重要信息推送给自己。 17. 做一个“灵感箱” 任何一闪而过的想法都丢进去。后面让 AI 自动搜索、补充背景、分类、处理,而不是靠脑子记住。 18. 盯住 GitHub 和 Product Hunt 让 Agent 帮你筛新项目、周榜、日榜和真正值得试的工具。看见感兴趣的,直接让它安装或进一步研究。 五、把输入变成你的输出 19. 把任何学习材料做成 HTML 学习页 看到一场好访谈、一个视频、一篇文章:让 AI 拉取内容、生成中文文字稿,边看边记评论,最后再变成摘要或短视频。 20. 给 Codex 一个“实体感”:做成桌宠 我很喜欢 Hatch Pet。它会根据状态跑动、办公、提示待办,甚至在你切换文件夹和工作区时给建议。AI 不一定要冷冰冰地躲在聊天框里。 100 亿 Token 给我最大的启发是: 不要把 AI 只当作“问答工具”或“临时外包”。 当它拥有你的上下文、目标、工作流和反馈后,它会越来越像一个能长期协作的系统。 换电脑时,我第一个装的软件就是 Codex。 写文档、做网站、剪视频、找资料、整理灵感……它已经覆盖了我工作和生活里非常大的一部分。 你最想让我把上面哪一条展开成教程? 评论区告诉我,我下一条就拆! #codex #chatgpt @thsottaux

Vivi Xiao

99,426 次观看 • 19 天前

我最近一边写内容,一边在验证一个问题: 如果要做一个面向 AI 创作者的小工具,到底该做什么? 直接问 AI“给我想个产品 idea”,意义不大。 它能给你 20 个想法,但不代表有人愿意付钱。 我最近用 Airtap Ai Airtap 跑了两个任务。 第一个很简单。 我给一个真实的美国号码发了一条 iMessage: +1 (650) 248-0054 “在 X 上帮我查一下今天最热的 AI 信息和话题。” Airtap 收到消息后,直接操作云手机里的 Chrome,打开 X 搜索。 我不用守在页面前,它会通过 iMessage 回传进度: “正在查看 Grok 4.6,整理高互动帖子。” “已经拿到 Grok Imagine 的数据,接下来检查 Claude 工具。” 过了一会儿,热点、原帖链接和互动数据就发回来了。 这个任务很适合做内容的人。 它像一份每日选题雷达,解决的是: 今天有什么值得写? 哪些海外话题可以转成中文内容? 并且它的入口非常方便,一项任务交给一条imessage就可以搞定。 但我还想解决另一个问题: 如果我要做一个服务 AI 创作者的产品,哪些问题真的值得做? 这次我在 Airtap 的 Web 端发了一个更长的调研任务: 去 Reddit 和 X 找 AI 创作者已经花钱、却仍没解决的问题。 我只保留四类讨论: 买过多个工具,问题还是没解决; 已经雇人或购买过服务; 每周仍要投入大量人工时间; 因为价格、功能或稳定性反复换工具。 同时要求它记录原帖、评论、链接、已经尝试的方案和实际成本。 任务跑起来后,我会在 Web 端看它执行: 搜索了什么关键词,打开了哪些帖子,有没有进评论区,又怎样切到 X 做交叉验证。 这一步对我很重要。 我要的是能回头核对证据,而非一份看起来很厉害的 AI 总结。 最后拿到的是一份付费痛点机会表。 其中有两个结论让我印象很深。 第一个是多工具订阅。 不少重度用户同时订阅 GPT、Claude 和一堆垂直工具,每月花费超过 100 美元,但依然搞不清额度、频繁遇到限流,还要处理支付和区服问题。 他们缺的不是又一个模型。 更像是一个能看清“钱花到哪、额度还剩多少、哪个工具该留”的管理层。 第二个是 AI 内容返工。 有些创作者已经付费买了生成工具,但内容出来后,还是要花大量时间改脚本、核对事实、去掉 AI 味。 他们要的也不是更多的生成。 而是把内容变成“能发、可信、像自己”的最后一步。 这份报告没有告诉我“做这个一定能赚钱”。 但它让我排除了一个方向: 我没必要再做一个 AI 内容生成器。 反而可以先验证一个更小的产品: 帮重度 AI 用户看清订阅、额度和重复支出。 下一步,我会把这个痛点做成一页简单的产品说明,找 10 个同时订阅 GPT 和 Claude 的创作者聊聊。 如果有人愿意给出自己的账单和额度使用情况,再做 MVP。 这就是 Airtap 给我的第二个结果: 不是帮我找到一个“看起来很酷”的点子。 而是帮我找到一个有公开证据、有付费行为、能继续访谈验证的产品方向。 如果这类调研想要长期做,还可以保存成 Routine,每天自动追踪 Reddit 和 X 上新出现的付费痛点,不用反复发同一段 Prompt。 我现在理解的 Airtap 工作流很简单: 临时内容任务,直接用 iMessage 发出去; 复杂调研任务,打开 Web 看过程、核对证据; 值得长期追踪的方向,再保存成 Routine。 完整调研报告和执行过程放在视频里。

木马人

43,659 次观看 • 3 天前

给大家带来 MiniMax-M3 实测! 本次测试包含了复杂前端, 后端 Agentic Coding, Agent 能力测试, 以及我的使用经验总结. 来看结论: 前端能力上, 可以完全适配 KCORES2026p2 的前端测试题目, 无论是空间理解, 建模精确度, 场景美学都十分在线, 其中我最满意的是美学部分, 它的颜色运用非常好. 不足的地方主要体现在复杂需求不能一次性写对(比如光追引擎), 需要迭代一下就可以了. 后端能力测试这次也是突飞猛进, 得分超过了 deepseek-v4-pro 和其他一众国产大模型, 略逊于 GPT-5.4-Pro(xhigh). Agent 能力上表现同样亮眼, 达成了榜单第二的接单量, 证明它的规划能力特别强。 下面是我在测试和实际使用中, 总结出来的 M3 使用经验, 供大家参考: 我的体感是 M3 特别喜欢推理, 它可以单次执行超长的推理. 在咱们的这些前端测试中, 它最长的输出甚至达到了我规定的 64k token上限, 所以, 不要上来就写一个超级复杂的 prompt 让它执行, 而是需要先把需求形成 plan, 然后让 agent 蜂群去执行, 这样才能得到理想的效果, 所以 M3 先天适合放在带 plan 模式的 Coding Agent 中使用. 如果把它嵌入到 Agent 框架中使用, 那么 prompt 编排就一定要做好, 不要一股脑把大量的 tool call 或者超大的 system prompt 丢给它. 还是需要下功夫好好编排一下的. 本次 M3 相比之前的 2.7 版本有了大幅度的提升, 模型偏好上来看, M3 是一个规划能力极强的模型, 所以特别适合用在一些规划性质的 Agent 框架中, 比如任务拆分, 日程管理, 流程设计等. 而本次暴露出来的不足则是执行过程中约束不够强, 比如 prompt 中设置的复杂规则, 一定要增加代码级别的 harness 闭环流程来进行约束, 而不能只靠模型本身来管理自己的行为. #minimaxm3 #minimax #agenticcoding #aiagent #harness

karminski-牙医

18,950 次观看 • 2 个月前

我折腾了Openclaw大概有一周了吧,感觉这一周也不能说时时刻刻在玩,但是确实已经让我体验到了他的很多优点和坑。 我觉得这个坑其实也并不是他的缺点,而且初学者在使用的时候没有注意到的特点,本文会好好聊聊。虽然有人说它不是什么高深的科技,但是Openclaw确实解决了我一个很长时间都没有人来解决的痛点, 作为一个web3的博主,我平常有很多零碎的时间,在外的时候,开车的时候,参加活动的时候,加起来其实非常多,一周下来能有十几个小时。 这些时候其实我的脑子都不处于idle的状态,而是经常想写东西。比如我经常就会抽个十分钟走路,边走边把我的一些想法和GPT录入,然后生成文章或者笔记,甚至是代码。 但对于有些问题,比如验证一个交易的想法,产品的想法,用一个我已经开发好的脚本去了解市场行情,缺少一个主机这样强大的工具来帮我落地。 也就是说,哪怕AI给了我方向,给了我代码,最后去跑的,还是我啊! 我这不是给AI打工了吗? 于是在知道了Opencalw这个东西的五分钟之后,我就边开车边在手机上下单了一个全新的MacMini,准备开始改变人生 我觉得玩了一周下来,我做到了。我可以躺在床上刷剧和喝啤酒的同时,让全市场行情尽收眼底,有一说一,minimax真的很稳定且偶尔会让人觉得惊艳。 刚丢给他anthropic和五角大楼的八个新闻,他给我做了系统性总结并归档,语言风格也非常自然,确实不是对话框可以体验的,但有在对话框环境里搞定了看黑漆漆IDE才能做到的aget效果,且效果很棒。这就是openclaw框架的特点。 接下来重点聊聊 #Binance 最近更新4个 AI skills 技能 Alpha 市场数据、U 本位合约、杠杆交易、资产管理。在我看来,这次更新的重点不只是“功能变多了”,而是 OpenClaw 终于更像一个能真正配合你做事的交易助手了。 以前我们用这类工具,更多还是停留在“查数据、看行情、问问题”这个层面,信息是有了,但真正做决策、盯条件、执行动作,还是得自己一步步来。现在不太一样了,你只需要说出自己的意图,它就能把筛选、判断、执行这些动作尽量串起来。 这 4 个技能里,我最看重的是资产管理。因为它解决的不是“看什么”,而是“钱怎么动”。比如现货和合约之间的划转、账户余额整理、碎币换 BNB,这些以前都很零碎,但实际又很高频。现在如果能交给 Agent 去处理,整体体验会顺很多。 另外,Alpha 数据、合约、杠杆这几个技能组合起来后,确实会让很多交易思路更容易落地。比如监测异动、看资金费率、设置止盈止损、按条件执行下一步,不用自己频繁切页面、算逻辑,效率提升会很明显。 不过我自己的看法是,这套skills最有价值的地方,不是“自动赚钱”,而是把原本复杂、重复、容易出错的操作流程对话化了。它更像是帮你提高执行效率,而不是替你承担判断和风险。 而且目前币安中文社区正在举办 “用 AI 建设加密,搭建币安主题 AI Agent” 的活动。 总奖池:48.6 BNB(作品奖44 BNB + 推荐奖4.6 BNB)。 作品奖:第1名10 BNB、第2名8 BNB、第3名6 BNB、20名优胜各1 BNB。 对普通用户来说,参与重点可以概括为一句话:不用非得做得特别复杂,能跑通、能演示、逻辑清楚,就有机会拿到奖励。赶快行动起来吧,部署一只属于你自己的龙虾,改变人生的轨迹。 为此专门做了一个接入视频,希望能帮助到大家一起建设起来~ 币安技能中心传送门: 部署龙虾碰到问题可以dm我或者评论区留言,欢迎老师们多多交流~

百里 🦅

16,721 次观看 • 5 个月前

国产最新的多模态模型来了!! 前两周我刚体验过国产的阶跃星辰大模型,没想到这么快他们的新模型 Step 3.7 Flash 就出了。 现在大模型一发布必卷 benchmark 分数,但真正做 Agent 的人都清楚:跑分高 ≠ 能把活干完。 所以这次阶跃星辰的新模型 Step 3.7 Flash 它再不追求单点最聪明、也不只是单次最快,而是主打“生产任务端到端执行效率”。 一个真实的 Agent 任务从来不是一次问答,而是规划 → 搜索 → 工具调用 → 代码生成 → 多模态理解 → 反复校验的完整闭环,Step 3.7 Flash 这次升级的重点是整条链路的效率,而不是某个孤立指标。 提几个我觉得挺务实的点: 1. 原生多模态模型:它可以直接处理 UI 截图、图表、仪表盘、文档,原生读懂并转成结构化输出和可执行步骤,不需要像一些模型那样外挂视觉理解 MCP,而且现在多模态是顶级模型的标配。 2. 推理加入搜索和视觉检索:网页搜索、图像搜索、视觉验证、多源信息比对,让 Agent 在开放任务里边查边验证边行动,而不是事后再接个外部工具。 3. 198B MoE、约 11B 激活参数,最高 400 TPS:稀疏激活 + 这个速度,意味着高频交互、多步工作流、反复工具调用的场景下,单位任务的成本和延迟都压得很低——快和省是一起来的。 4. 开源、可部署:生产环境要的不只是 API,还有透明度、可控性和部署灵活性。 如果你在做 AI Agent、coding 工作流、搜索类应用或多模态系统,值得用 StepFun 试试这款新模型的能力。 想看更进阶的平台能力,可以了解 Step Plan。 海外平台: 国内平台:

耳朵

12,197 次观看 • 2 个月前

斯坦福2023年公开课CS25 - 大语言模型与人类对齐(中英文字幕) 这是斯坦福2023年公开课CS25的第二课:《Language and Human Alignment》,讲师是OpenAI的Jan,他目前领导OpenAI的对齐(Alignment)团队,并曾在DeepMind担任研究员。他拥有强化学习理论博士学位,并且在过去的10年里一直在思考对齐问题。 这节课的主要内容是探讨AI的对齐问题,也就是如何让AI系统符合人类的意图和偏好,以及如何构建能遵循人类意图的AI系统? 遵循人类意图意味着:对于明确的意图,能遵循指令,成为一个可靠的助手;对于不明确的意图,需要通过后续问题明确,不要编造,不要做有害的事情。 现在使用的主要技术是强化学习反馈,这是用来训练InstructGPT和ChatGPT的技术。首先需要训练一个奖励模型,然后要用人类标注员去标注数据,来告诉模型哪些结果更是人类想要的。虽然每个人类标注员都有自己的偏好,甚至可能有不一致的地方,但模型会多结果进行平均。 从成本上来说,人类反馈的成本要远低于预训练的成本,不到预训练计算量的2%。基于人类反馈的强化学习(RLHF)可以让模型做任何它想做的事情,它可以自己找出最好的方法来做事情,你只需要对它的结果进行评估就好了。 “评估比生成容易” 很多任务虽然人类不擅长,但是可以很容易的给出评估。 RLHF也有一些限制,比如当人工智能进化到一定程度,其可以完成的任务难度也会提升,但是人类评估任务的水平却无法提高,这时候人类将无法再给AI有效的反馈。所以未来我们需要AI来辅助人类进行评估,让AI帮助指出结果中的问题,人类对AI评估的结果进行评估。 课程页面: 参考材料: - ChatGPT: - InstructGPT: - Language Models are Few-Shot Learners (GPT-3):

宝玉

149,092 次观看 • 3 年前

很多人一聊到选哪条链?第一反应都是: 热度高不高?补贴多不多?生态有没有流量? 但今天听了 Talus 🐸 CEO Mike Hanono 和 The Rollup 的视频会议,我反而有种感觉:这不是在给 Sui 站台,更像是一场技术自白。 首先Talus 选 Sui,真的不是因为它现在火。而是因为 Talus 想做的这件事,在别的链上,很难跑得像样。先说清楚一点:Talus 要做的不是一个 AI 应用,也不是几个 bot、几个策略脚本。它想做的是——一个大规模、自主运行的代理网络:成千上万个代理同时运行、同时决策、同时交互。光是这个前提,就把底层链的门槛直接拉满。 为什么是 Sui?我听下来,核心其实就三点。 第一,并行执行。代理世界不是排队点菜,不是你先我后那种单线程逻辑。代理一多,如果底层还是串行执行,结果只有一个:越跑越卡,最后只能做 demo。Sui 的并行执行,本质上就是为“多主体同时操作” 这种系统准备的,这点和 Talus 的形态非常贴合。 第二,高吞吐量。代理不是偶尔动一下,而是持续、高频地产生状态变化。TPS 要是撑不住,所有“自主”“实时”都会变成慢动作回放。对 Talus 来说,吞吐量不是加分项,是能不能活下来的前提条件。 第三,移动端和安全模型。这一点很多人会忽略。未来代理不只在服务器、交易后台跑,它一定会越来越靠近用户。Sui 在账户模型和安全设计上,本身就更像现代应用,而不是早期 DeFi 那套「钱包就是一切」的逻辑。 所以当 gmike 说“我们一直都是 SUI Maxis”,我反而觉得这句话挺克制的。这不是情绪站队,而是工程师视角下的现实选择。至于多链?我自己的理解是:Talus 不是不懂多链,而是很清楚——在基础设施阶段,过早多链只会把复杂度放大。尤其是代理这种高度耦合、强调协同的系统,先把一个底层跑通、跑稳,比到处铺点重要得多。很多项目喜欢先讲“未来多链叙事”, 但真正做底层的人,往往会先问一句:现在这个系统在哪条链上能真正跑到规模?从这个角度看,Talus 的选择是理性的,也是偏长期的。不追热点,不抢流量,先把代理世界里最难的那一块解决掉。这种项目短期不一定最热,但一旦真跑起来,后面的持续热度,反而会非常高。 Kaito AI 🌊 #Yapping #MadewithMoss MOSS #Starboard Galxe River River4FUN 🐝

百里 🌊RIVER | MemeMax⚡️|🧠SENT

13,710 次观看 • 8 个月前