Загрузка видео...

Не удалось загрузить видео

На главную

我第一次用 Ling 3.0 flash,做的只是一个很基础的任务,整理50条用户评论。 评论来自不同用户,内容很杂。有 bug 报告,有功能请求,也有对整体体验的评价。 过去处理这类材料,我得一条条读,再手动归类重复问题,统计出现频率,最后才能开始写汇总报告。这个过程不难,却很耗时间,也很容易漏掉信息。 ## 把重复劳动交给模型 这次我把全部反馈一次性发给 Ling 3.0 flash,同时给了它一套更清楚的处理流程。 它需要完成的事情包括。 - 对评论按主题分类。 - 提取每条反馈里的核心信息。 - 合并重复或高度相似的建议。 - 去掉无关和冗余内容。 - 输出一份可直接查看的汇总报告。 几分钟后,结果就出来了,结构很清楚,查看起来也很省力。 像记录问题,增加深色模式,一次性导出多条消息这类反复出现的建议,都被归到了一起。不同类别的反馈也完成了统计,哪些问题出现得更多,一眼就能看出来。 ## 模型负责产出,人负责判断 这件事帮我省下来的,不只是阅读五十条评论的时间。 我不需要反复检查有没有遗漏,也不用重新核算相似评论,更少了很多手动整理时容易发生的小错误。 模型没有替我决定产品该怎么做,它只是把杂乱的信息整理成了我能判断的材料。 产品要不要做深色模式,导出功能该排在什么优先级,bug 修复要投入多少资源,这些决定依然要由人来做。 我觉得这才是更接近真实工作场景的 AI 用法。人掌握目标,规则和最终决策,模型承担整理,归纳,格式化和生成这些执行工作。 ## 很多办公任务,不需要顶级推理 不少办公场景并不缺复杂思考,真正缺的是稳定完成重复任务的能力。 日常工作里,经常会遇到这些事情。 - 阅读一批文档。 - 汇总不同来源的材料。 - 统一格式。 - 按既定规则分类。...

14,412 просмотров • 2 месяцев назад •via X (Twitter)

Комментарии: 41

Фото профиля 🍭吃货不怕胖
🍭吃货不怕胖2 месяцев назад

这个感觉不错啊

Фото профиля 拳头👊🕊️
拳头👊🕊️2 месяцев назад

是不错 累死我了😅

Фото профиля mmm666
mmm6662 месяцев назад

这破玩意儿居然能理清这种乱七八糟的评论?之前手动分类到怀疑人生,这波直接封神。

Фото профиля 拳头👊🕊️
拳头👊🕊️2 месяцев назад

以前碰到这种杂乱评论直接头疼,现在总算有工具能接这活。

Фото профиля Xin Chen 🐉
Xin Chen 🐉2 месяцев назад

同感!整理用户反馈这种重复劳动最耗时间,交给 Ling 3.0 flash 分类去重统计,几分钟出报告,确实省心。

Фото профиля 拳头👊🕊️
拳头👊🕊️2 месяцев назад

@xincheng422315 如果是我是你,会先用它跑一遍关键词提取,再手动核一下分类准确率,Ling 3.0 flash对技术术语的理解不错,但偶尔会把性能抱怨误归为bug。

Фото профиля Thuy Signals (✱,✱)
Thuy Signals (✱,✱)2 месяцев назад

其实这种长文档总结如果不设好提示词还是会瞎编。

Фото профиля 拳头👊🕊️
拳头👊🕊️2 месяцев назад

试过类似任务,这版本对多源评论的提取比之前干净不少。

Фото профиля web3 lawyer 首席大律师
web3 lawyer 首席大律师2 месяцев назад

KYC/AML材料里80%是重复提取和分类,根本用不上R1级别的推理。便宜稳定的执行层模型才是刚需,Ling 3.0 flash 这定位抓得很准。但有个真问题:如果它把“可疑交易”归类错了,导致监管漏报,责任算厂商还是算用户?

Фото профиля 拳头👊🕊️
拳头👊🕊️2 месяцев назад

50条评论整理下来,flash省了我大半时间,手动做至少一小时。

Фото профиля Alice-007
Alice-0072 месяцев назад

Ling 3.0 flash 几分钟就按主题分类、合并重复、排出优先级(P0/P1/P2),还直接出结构化报告,效率拉满

Фото профиля Yuze
Yuze2 месяцев назад

50条乱七八糟的评论直接一锅端给Ling 3.0 flash,几分钟就分类去重统计完,报告直接能用,我之前手动整这种破事真的能崩溃。 确实啊,AI就该干这种重复劳动,决策还是人来,效率直接拉满。

Фото профиля 骄阳 (bitcool)
骄阳 (bitcool)2 месяцев назад

Ling 3.0 flash 只用来整理评论太小看它了,它的执行力很强可以逐步给它更专业的任务,你会发现惊喜的

Фото профиля Canjian | 残剑
Canjian | 残剑2 месяцев назад

Ling 3.0 flash可靠性还是挺高的,效率也高

Фото профиля 周东野
周东野2 месяцев назад

这个体验挺真实的。整理杂乱评论这种事,过去确实得一条条看、手动归类,耗时还容易漏。现在把流程交代清楚,模型负责分类合并、输出结构化报告,人只做最终判断,效率差很多。很多日常任务其实不需要最强推理,稳定执行重复流程,才是真正能省下时间的地方。

Фото профиля 拳头👊🕊️
拳头👊🕊️2 месяцев назад

说实话flash系列的性价比挺高的,做这种重复性分类任务比gpt-4-turbo省不少钱,我上个月把内部工单归类全切到它上面了,效果意外地稳。

Фото профиля IMOLEAYOMIDE
IMOLEAYOMIDE2 месяцев назад

After grouping high frequency demands like dark mode, export functionality, and bug fixes together, the priority ranking becomes much clearer. Otherwise, looking at them scattered around makes it easy to miss the key points

Фото профиля 败犬女王~
败犬女王~2 месяцев назад

太快了吧 真省心

Фото профиля 狼之羊(欲哭无泪ing)
狼之羊(欲哭无泪ing)2 месяцев назад

是的,试用了一下,感觉不错 把它当成一个执行力超强的下属非常不错 你只要给它下指令即可 AI落地应用就应该这样,而不是搞一些大而空的东西

Фото профиля 加密小川|币安欧意返佣40%
加密小川|币安欧意返佣40%2 месяцев назад

效率提升真让人羡慕

Фото профиля 元行者
元行者2 месяцев назад

手动整理确实很容易漏东西,尤其是五十条以上的时候,读一遍容易漏,读两遍又太费时间。

Фото профиля 幻想 | Gate打金狗0Gas费
幻想 | Gate打金狗0Gas费2 месяцев назад

重复劳动交给模型,效率提升太明显了

Фото профиля CV alpha | GYNDORE DAY ONE
CV alpha | GYNDORE DAY ONE2 месяцев назад

我也用类似工具处理过DAO

Фото профиля 熊猫林(131419)🐼A8
熊猫林(131419)🐼A82 месяцев назад

AI工具的进化速度在加快!我们也要赶上啊!

Фото профиля Knight
Knight2 месяцев назад

最近被这个AI刷屏了,搞得好想试一试

Фото профиля 良轩Mr蒋
良轩Mr蒋2 месяцев назад

确实很不错~

Фото профиля 流动性摆渡人
流动性摆渡人2 месяцев назад

这波操作比我快

Фото профиля OG FIGO 🚢
OG FIGO 🚢2 месяцев назад

This is a great example of how AI can quietly improve everyday workflows without taking away human judgment. Organizing messy feedback is exactly where these tools can save valuable time and energy.

Фото профиля The LLM Note
The LLM Note2 месяцев назад

Sounds like a good start! Any particular challenges with the variety?

Фото профиля MoCuishle I Fang🎒
MoCuishle I Fang🎒2 месяцев назад

深有同感。以前用AI总想考考它,看它能不能解难题;真干活了才发现,最烦人的根本不是难题,是这种50条评论的整理活——动脑子不多,但眼睛看花、手点断。 Ling 3.0 flash 这次给我最直观的感受是,它不需要替我做决定,也不用给我什么惊喜,把归类、去重、统计这三件事干到位就行了。报告出来我能直接拿去用,不用再对着原始记录来回核对一遍。

Фото профиля Lubov
Lubov2 месяцев назад

真是跟不上步伐了,现在工具太强劲了、、、

Фото профиля XZ 星展
XZ 星展2 месяцев назад

这个体验分享太实用了! 整理杂乱评论这种重复活,确实最适合交给像 Ling-3.0-flash 这种又快又稳的模型。

Фото профиля king | 来Gate事件合约抢百万积分
king | 来Gate事件合约抢百万积分2 месяцев назад

这个工具可以生成的内容很强

Фото профиля 洛一可🍥
洛一可🍥2 месяцев назад

看了一下逻辑挺通顺~关键看后续流动性支撑、社区共识与落地执行力 ₍˄·͈༝·͈˄*₎◞ ̑̑~

Фото профиля eunoia
eunoia2 месяцев назад

工具太多太杂也不知道具体哪个好用。

Фото профиля Ox糖豆
Ox糖豆2 месяцев назад

太省心了吧

Фото профиля ApeCaptain
ApeCaptain2 месяцев назад

看起来很不错

Фото профиля 红茶
红茶2 месяцев назад

今天我被这个Ling 3.0 flash刷屏了

Фото профиля 忘川🦦|币安欧意返佣40
忘川🦦|币安欧意返佣402 месяцев назад

你找到了AI的正确用法 省时省力还靠谱

Фото профиля Ran
Ran2 месяцев назад

确实实用!这种重复整理评论的活交给 Ling 3.0 flash 最合适,结构清晰又省时,决策还是留给人来做,效率直接起飞。

Фото профиля 明观
明观2 месяцев назад

看完你的实测,我感觉我那堆乱七八糟的操作日志也有救了!😂 以前总觉得 AI 离我很远,非得问它点人生哲学。现在发现,能帮我把这几十条碎碎念理成表格,那就是真的‘封神’。这种不烧脑但费时间的活儿,以后真的都得扔给它干!

Похожие видео

Ling-3.0-flash :一个更适合实际工作的 AI 执行助手 过去一段时间,大模型的发展重点一直集中在能力提升上。模型能回答什么问题、能处理多复杂的任务,成为行业关注的焦点。但随着 AI 开始进入真实工作流程,用户对于模型的期待也在发生变化:除了能够提供高质量答案,更希望它能够稳定、高效地完成具体任务。 在日常工作中,真正消耗时间的往往不是复杂问题,而是大量重复性的处理工作。例如整理资料、分析数据、生成文档、处理代码、执行流程任务。这些事情需要投入大量精力,但其中有很多环节都可以通过 AI 进行优化。 Ling-3.0-flash 的定位正是在这一方向展开。它并不是单纯追求更大的模型规模,而是聚焦 Agent 工作流中的执行效率,帮助用户将明确的任务快速推进完成。官方介绍,该模型面向长程 Agent 工作流设计,重点提升响应速度、工具调用能力以及任务执行稳定性。 从实际体验来看,它最大的特点是能够很好地融入已有工作流程,让 AI 从一个问答工具变成一个真正参与任务执行的助手。 实测一:资料整理效率明显提升 第一个测试场景是长文档处理。 在实际工作中,经常会遇到需要快速阅读大量资料的情况,例如行业报告、会议记录、产品文档等。如果完全依靠人工整理,需要花费大量时间筛选重点、提取信息,再重新组织内容。 测试过程中,我将一批较长的资料交给 Ling-3.0-flash 处理,让它完成信息提取、重点归纳和结构化整理。 整个过程比较符合实际工作习惯。它能够快速抓取文档中的核心内容,并按照任务要求整理成更加清晰的结构。尤其是在面对大量相似信息时,它可以帮助用户减少重复阅读和手动整理的时间。 这类能力对于内容运营、产品分析、市场研究等岗位非常实用。很多时候,用户并不是需要 AI 替自己完成最终判断,而是希望它先完成信息整理,把大量基础工作处理好,让人可以把精力放在更重要的分析和决策上。 实测二:代码协作更加高效 第二个体验场景是代码辅助。 AI 编程已经成为大模型应用的重要方向,但真正影响开发效率的,不只是生成代码的速度,更重要的是能否持续参与开发过程。 在测试中,我让 Ling-3.0-flash 协助完成一个简单工具开发任务,包括生成基础代码、调整功能逻辑以及根据反馈进行优化。 我需要做一个AI 会议纪要整理助手,请帮我生成代码,把会议录音转文字或会议记录,自动生成:会议摘要、决策事项、待办任务、负责人、截止时间 首字耗时:337ms·完成耗时:68984ms·每秒 token 数:371 ,Ling-3.0-flash生成的会议纪要整理助手功能完整、专业美观,支持录音转文字、AI自动生成摘要/决策/待办任务,并支持导出和多种交互功能。 实际体验下来,它更适合成为开发过程中的协作助手。开发者可以先确定整体需求和功能方向,再让 AI 快速完成代码生成、修改和补充。这样一来,开发者不需要把大量时间花在重复编码和基础调整上,而可以更多关注产品逻辑和技术方案。 这种协作方式更接近真实开发场景。人负责判断方向,AI 负责提高执行效率。 实测三:批量任务处理展现执行优势 除了开发场景,批量信息处理也是 Ling-3.0-flash 比较适合的方向。 例如整理用户反馈、分析业务数据、处理文本分类等任务,通常具有数据量大、格式相对固定的特点。 在测试中,我模拟了用户反馈整理场景,让模型对大量文本进行分类,并提炼其中的主要问题。 从结果来看,它能够快速完成信息归类,并输出较为清晰的结构化结果。 这类任务的价值在于帮助用户减少大量机械操作。以前需要人工逐条查看和整理的信息,现在可以先由 AI 完成初步处理,再由人工进行确认和优化。 对于企业团队来说,这种能力可以应用在客服分析、市场调研、内部知识整理等多个环节。 速度和效率,是 Flash 模型的重要优势 随着 AI 应用逐渐深入业务流程,模型的效率同样成为重要指标。 很多实际任务并不需要每一次都进行复杂推理,而更需要快速响应和稳定执行。例如信息分类、内容整理、数据转换等工作,如果能够以更高效率完成,就能明显提升整体生产力。 Ling-3.0-flash 支持混合思考模式,可以根据任务复杂程度调整处理方式,在响应速度和任务能力之间进行平衡。 这种设计让它更适合高频使用场景。用户可以将更多日常任务交给 AI 处理,而不必担心流程效率受到影响。 从使用体验来看,它更像一个高效执行伙伴 经过几个场景测试后,Ling-3.0-flash 给我的整体感受是,它并不是单纯提升聊天体验,而是在帮助用户重新分配工作时间。 它可以处理大量信息整理工作,可以辅助开发过程,也可以参与自动化任务执行。 对于普通用户来说,它能够减少重复操作,提高工作效率。 对于开发者来说,它能够加快开发流程,降低基础工作的时间成本。 对于企业来说,它能够帮助更多业务流程实现自动化。 未来 AI 的价值,不只是回答问题,而是逐渐参与到真实工作流程中,帮助人完成更多具体任务。 Ling-3.0-flash 所体现的方向,就是让 AI 从一个提供答案的工具,进一步成为一个能够执行任务、提升效率的工作伙伴。 官推: 感兴趣可以自己试试 👉

冰糖雪梨

15,661 просмотров • 2 месяцев назад

蚂蚁百灵刚刚发布了 Ling-3.0-flash: 一个AI 执行层的关键拼图 刚刚看到 Ling-3.0-flash 正式发布,我觉得这款模型值得认真关注。原因很简单:在 AI 工程越来越深入到实际业务的今天,大家早就不满足于模型“会不会想”了,更关键的是它“能不能持续做”。 尤其是在 Agent 工作流中,需要高频调用工具、迭代代码、处理长程任务时,一个响应快、执行稳的执行引擎成了刚需。Ling-3.0-flash 的出现,正好瞄准了这个缺口。 1. Agent 的执行层 从我的角度看,它最聪明的一点是没有去硬拼超大模型的深度推理能力,而是把自己定位成一个高速执行引擎——负责把已经规划好的任务快速落地。 这在实际应用中特别实用,比如当大模型把方案设计好之后,剩下的代码生成、工具调用、批量处理就需要一个既快又稳的模型来接手。 2. 为什么它能兼顾速度和成本 技术细节上,它采用 124B 参数的 MoE 架构,但实际激活参数约 5.1B,在推理速度和运行成本之间找平衡。 它还支持混合推理模式:简单任务可以关闭 Reasoning,降低延迟,适合大批量处理;复杂任务则可以开启思考模式,保持逻辑连贯。 原生支持 256K 上下文,对需要持续读取历史指令和项目状态的 Agent 工作流也很重要。 3.如何使用 我觉得 Ling-3.0-flash 最适合做 Agent 工作流里的执行节点。反复调用 API 或 MCP 工具时,它能根据结构化错误信息自我诊断和修复,不容易在循环调试中卡死,因此适合放进 Loop 或 Graph 架构。 4.结对编程和批量任务 结对编程是一个典型场景:人负责架构规划、边界定义和测试,Ling-3.0-flash 负责快速生成代码、调用工具、读取报错,并根据反馈持续修改。 批量处理长文档、日志、简历和结构化数据时,它看重的也是速度、格式稳定性和成本控制。直播数字人或高频办公协作,则需要它的低延迟响应来减少体验断层。 5.边界 当然,它不是万能模型。复杂系统不能只靠一句指令搞定;缺乏架构和测试环境时,结果可能跑偏;需要深度冷门知识的研究任务,还是更适合交给更大规模的推理模型。 更合理的用法是:大模型负责搜索、规划和架构设计,把方案写成规范文档;Ling-3.0-flash 负责高频工具调用、代码执行和批量处理。 总结:Ling-3.0-flash 不是来替代所有模型的,而是把 Agent 工作流里“执行层”这件事做得更快、更稳。大模型负责想清楚,它负责做出来。

奶牛叔

66,157 просмотров • 2 месяцев назад

这两年我一直有个默认假设:模型参数越大,能力越强,什么任务都该交给最大的那个模型去做。但最近我在搭一个需要长流程、反复调用工具的 Agent 任务时,专门试了试把"规划"和"执行"拆开、交给不同模型来做的思路,用的执行端模型是Ant Ling刚发布的 Ling-3.0-flash。这次体验让我对"大模型不是越大越好"这句话有了更具体的理解。 我遇到的问题 起因是我想搭一个 Blender MCP 的工作流:让 AI 帮我自动完成一个简单场景的粗模搭建和运镜——比如摆几把椅子、设置一个摄像机轨迹,作为后续正式渲染前的预演草稿。 一开始我图省事,直接让一个参数量很大的全能模型来处理整个流程:既要它想清楚场景该怎么布局、镜头该怎么运动,又要它高频地调用 Blender 的 MCP 接口去逐步执行动作。 结果是,虽然效果还行,但每一步操作等待的时间都不短,跑完一整套流程花的时间和成本都超出了我的预期——毕竟这类任务里,真正需要"深度思考"的部分只占很小一块,绝大多数时间都花在了"调用接口、摆放物体"这类重复动作上。 换成"规划-执行分离"之后 我把流程拆成了两段:先用一个知识面更广的大模型,把场景的整体构图、镜头运动路径想清楚,写成一份结构化的操作说明;然后把这份说明交给 Ling-3.0-flash,让它作为执行引擎,逐条读取说明并调用 Blender MCP 接口去落地。 这一次的差别很明显。Ling-3.0-flash 的总参数量是 124B,但实际推理时只激活 5.1B 参数,加上首字延迟能做到 500 毫秒以内,我能感觉到每一步操作的响应几乎是"秒回"的——不再是那种等大模型"想"完再动手的节奏,而是我一条指令下去,场景里的物体几乎立刻就摆好了。整套流程跑下来,成本也比全用大模型的方案低了不少。 我的体会 这次尝试让我确认了一件事:如果任务里"想清楚该怎么做"和"把已经想清楚的事情执行出来"这两部分能拆开,那把执行这一段交给 Ling-3.0-flash 这类专门优化过工具调用稳定性和响应速度的模型,确实比一个模型包办到底更划算。 但我也发现,这套分工不是无脑套用的——如果场景本身很复杂,需要边搭建边做美学判断(比如构图是否好看、光影是否协调),单靠 Ling-3.0-flash 自己去决定,效果就会打折扣,这部分还是得靠前期规划阶段先想清楚。 人负责把边界和验收标准定好,大模型负责规划,Ling-3.0-flash 负责又快又稳地把方案落地——这套组合让我第一次比较直观地感受到"规划-执行分离"这套架构的实际好处。 目前Ling-3.0-flash 现已在 OpenRouter 上线——并可免费使用至 2026 年 8 月 3 日。 链接: 也可以直接网页对话体验: 大家不妨去体验体验一下,感受下魅力

韭菜饼子

83,352 просмотров • 2 месяцев назад

Codex 隐藏玩法:把你每天重复教 AI 的提示词,直接做成 Skill 90% 的人用 Codex,其实都在重复做同一件事: 开一个新任务,把同一套要求再告诉它一遍。这些 Prompt 你可能已经复制粘贴了几十次。 但其实,这种反复使用的工作方法,完全可以直接做成 Codex Skill。 详细教程如下: 1️⃣先找一段你经常重复使用的 Prompt,比如我最近一直在用这类提示词: “执行任务前先检查需求漏洞和潜在风险,不要默认接受我的方案。涉及代码和结论必须验证,完成后按验收标准逐项检查。” 这类 Prompt 很好用,但最大的问题是:每开一个新任务,都要重新贴一次。 2️⃣直接让 Codex 把它做成 Skill把原来的 Prompt 发给 Codex,然后告诉它: 请把上面这套工作方式整理成一个可重复调用的 Codex Skill。 要求: · 明确这个 Skill 适合在什么情况下使用 · 把原来的要求整理成清晰的执行步骤 · 区分任务开始前、执行过程中和完成后的检查 · 保留必要的验证流程 · 删除重复和模糊的要求 · 不要改变原来的核心工作原则 Codex 就会把原来散乱的一段 Prompt,整理成一套完整的 Skill 工作流。 以后这些规则就不用一直躺在聊天记录里了。 3️⃣ 后面直接调用这个 Skill 再开新任务时,不需要重新复制那一大段 Prompt。 直接告诉 Codex:使用这个 Skill 完成当前任务。 最后你的 Codex 里保存的,就不再是一堆 Prompt,而是你自己的一整套工作流。 Prompt 是教 AI 这一次怎么做。 Skill 是把你的工作方法直接固化下来,以后每个项目都能重复调用。

爱丽丝呀!

40,828 просмотров • 1 месяц назад

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,630 просмотров • 6 месяцев назад

绝了!这应该是最适合接入视频剪辑工作流的AI!! 因为它真正能看懂视频,并且够快够便宜! 对于做视频,不管是专业还是非专业选手,最耗费时间的其实就是找素材,和选素材! 好几个小时的素材,可能真正能用上的就几分钟! 而为了找到合适的,往往需要把每一条都从头看完, 根据脚本反复拖动时间轴、记录和剪切可用的素材。 这非常费时间,一点也不AI。 我也试过用很多AI来解决这个需求,包括一些所谓的视频素材AI管理工具, 能读视频的多模态模型其实很多,靠截图的方式能够理解视频的内容, 但也仅限于知道视频的内容,因为这些模型不太能理解视频里各个镜头和画面的时间关系。 这次看到 Ant Ling 新出的多模态模型 Ling-3.0-flash-VL, MoE架构,总参数124B、有效激活5.5B参数,支持256K长上下文和VideoRoPE时空编码。 激活参数更小,说明成本更低! 这个VideoRoPE时空编码,据说是靶向解决我上面说的那个问题! 第一时间测试了一下!! 我丢给它一个演讲的视频,让它告诉我讲了什么,有什么重点, 另外我告诉它,我想基于这个演讲视频剪辑一个高光短视频,需要它帮我找到一些高光时刻,然后告诉我准确的时间码,并且为这个高光短视频写一个文案。 这已经不是单纯的“视频总结”之类的简单任务, 它需要按照时间线给出: 高光时间段+核心观点+入选理由+建议标题+开头钩子+发布文案。 这应该才是多模态模型能够发挥价值的地方!! 普通模型可以告诉你“一小时的视频讲了什么”,但内容创作真正需要的是:这一小时里,到底哪些能够用,要怎么用? 让我比较惊喜的是,它不光给了我高光视频剪辑要用的分镜、脚本、文案,甚至还给了我转场、和BGM的建议! 完全就是一份可以照做的剪辑执行单!! 这说明和它对原视频的理解已经远超我的预估!! 我在想,也许可以把这套能力接入剪辑工具,整个工作流就还可以继续延伸: 读取视频 → 理解内容 → 定位高光 → 输出时间码 → 调用工具裁剪 → 生成标题和发布文案。 完全实现视频剪辑自动化!! 当然,理想是丰满的,AI挑出的素材不一定全都符合审美和叙事偏好, 时间码和上下文完整性也需要人工复核。 要想创作出好的视频作品,必然还是需要人的参与! 不过,用AI搞定素材的初筛,也是目前的超级刚需啊!!

沐阳

22,618 просмотров • 23 дней назад

自从马云重新现身后, 蚂蚁集团一直猛冲AI,大动作不断! 像是卯足劲在追赶阿里QWEN! 最近更是连发两款实用拉满的模型!!! 先是百B级的 Ling 2.6 Flash, 盲测阶段就冲上 OpenRouter 趋势榜第一, 直接火到了海外!! 还不算完,Ant Ling 今天又甩出一张底牌: Ling 2.6 1T ! 名字就能看得出来,这个模型能力会更强!! 但有一个误区:能力强的不一定是思考模型! Ling 2.6 1T 不靠拉长推理链条来显得"很聪明", 而是把 token 更多花在理解、规划和输出上。 换句话来说: 它的核心定位,是面向复杂任务,是精准指令下的执行模型!! 1M 超长上下文,能把会议纪要、群聊记录、项目文档、零散资料一次性扔进去统一处理。 强工具调用能力,可以接进 OpenClaw、Hermes、LangGraph、Dify 等跑工作流。 真实问题处理,不只生成漂亮 demo,而是能够读懂已有代码,按照你的要求去干活。 Token 效率更高,不默认展开超长思考,成本控制到最低。 最近一段时间都是免费用,不用白不用, 我拿了几个真实任务跑了一遍,感受超级明显—— 如果是模糊的指令,它可能不太适合。 但如果是比较详细的指令,给它一个工作流, 就完全起飞了!! 没有了推理过程,感觉非常丝滑, 这一点,就挺重要的!! 减少了很多“AI自作聪明”的麻烦!! 说回蚂蚁这两款模型, 完全是冲着落地应用来的,几乎把简单和复杂的应用场景全部包圆。 1T 负责理解复杂目标、拆解任务、整理材料、制定计划。 Flash 负责快速执行、快速改写、快速补全。 这精准切入了现在大多数人用AI的“痒点”: 总想着用一个“最强模型”解决所有的事情。 但我认为真正重要并且正确的是: 让对的模型干对的事。 这样无论是速度、成本、还是结果一致性,都更能符合预期。

沐阳

116,421 просмотров • 5 месяцев назад

Claude Opus 4.8 出了之后,我的第一反应是:想试。 第二反应是:算了,token 这东西真的不经烧。 结果看到 ZenMux 现在可以体验 Opus 4.8,就拿它试了一个我最近一直想做的小东西。 我自己有个很真实的问题: 脑子里经常冒出各种产品想法。 但每次真要开始做,就会卡住。 用户是谁? 第一版到底做什么? 哪些功能应该先砍掉? 怎么定价? 第一周从哪一步开始? 上线后怎么找第一批用户? 想法很多,执行很散。 所以我让 Claude Opus 4.8 做了一个「一人公司作战室」。 需求我写得也挺直接: 输入一句产品 idea。 自动拆出产品定位、MVP、开发任务、定价方案。 再生成落地页文案、冷启动实验、风险清单和本周计划。 最好不是一个静态页面,而是真的能点、能改、能导出。 然后我就把这段话丢给 Claude Opus 4.8。 出来的效果比我预期好不少。 它真的把“一人公司怎么从想法走到执行”这件事拆开了。 左边输入产品想法。 中间生成产品蓝图、MVP 范围、定价和官网文案。 右边是任务看板和本周计划。 底部还有冷启动实验、风险雷达和 Markdown 导出。 最让我觉得有意思的是,它不是一味堆功能。 比如我输入“给小红书博主做 AI 选题助手”,它会主动判断: 第一版必须做什么。 哪些功能看起来高级,但现在应该先别碰。 怎么找第一批真实用户。 哪些风险可能让这个项目做不下去。 这点就很能体现 Opus 4.8 的能力。 普通模型经常是:你要什么,我全给你加上。 最后页面很热闹,但产品判断是空的。 Opus 4.8 更像是在帮你收敛:先想清楚用户、场景和第一步,再把它变成可以执行的工作台。 我是在 ZenMux 上试的。 它比较方便的一点是,一个 Key 就能切不同模型,新模型上线也很快。 Opus 4.8 拿来做这种带产品判断、交互状态和复杂信息结构的网页,确实挺顺。 想试 Claude Opus 4.8 的,可以从这里进:

Joruno

16,224 просмотров • 4 месяцев назад

昨天用 DAPPOS 的 xBubble Coding 搭了个小工具,专门盯头部账号互动和事件市场信号。 起因很简单。我刷到某个头部交易所创始人,回复了一条内容账号的推文,底下还顺手点了个赞。 我切到相关代币的 K 线看了一眼,市值直接拉了几千万!这种机会如果只靠人一直刷推,很难卡到前面的位置。尤其是链上 meme,很多注意力信号本来就不是从公告开始的。 可能是头部账号的一次点赞。也许是交易所创始人的一次回复。或者是项目方和 KOL 之间的一次互动。 我当时就在想,这种信号如果能自动抓下来,再接一层策略判断,自动买入,那岂不是能赚麻了!比别人先看到消息,然后提前卖出获利 刚好最近看到 xBubble 官方演示里有一个 Polymarket 事件检测和交易辅助案例,思路跟这个很像不是让人手动盯每条信息,而是把事件、信号、价格、市场变化串成一条流程。 我就顺着这个方向,用 xBubble Coding 搭了一套 Web3 交易信号工具。 测试版本: 流程大概是这样:推特那边一出现新互动信号,系统先自动抓下来,抓完之后,先过一层策略匹配,只有命中我设定的规则,才继续往下走。然后查一遍白名单库,筛出我真正关注的资产。再查一次钱包缓存,看有没有相关地址和历史行为。接着生成一份代币价格简报。 如果是 Polymarket 这类事件市场,还会同步整理事件状态、赔率变化、相关信息源和潜在交易方向。最后把符合条件的内容,提交到预设链上流程里。 这就是“追头部账号”和“追事件市场”真正能产生的结果。是把一个轻互动信号,变成一套可以执行的交易观察链路。 以前我是刷到相关信号之后,再手动去查币、看价格、翻钱包、看链上数据。那时候已经到接盘的时间了。现在是信号自己进入流程,系统帮我先完成筛选、整理和下一步动作。 这个变化很关键。因为 xBubble Coding 真正有价值的地方,不是帮我生成一段代码,而是把一个具体场景封装成一条端到端的业务 SOP。 我这次做的,其实更像是一套小型 Web3 交易信息服务。前端是头部账号互动监控和事件市场检测。中间是策略匹配、资产筛选和信息源整理。后面接价格简报、钱包缓存、赔率变化和链上流程。 这条链路跑通之后,它就不只是一个工具,而是一个可以持续迭代的个人信息优势系统。 这也是我理解 xBubble 商业价值的地方。它卖的不是代码本身,而是端到端的业务服务。 对小团队和个人来说,真正卡住人的往往不是“能不能生成一个页面”,而是能不能把内容、数据、流程、支付、执行和后续修改串成一个闭环。 xBubble 的 SOP 系统,核心就是把这个门槛压低。你可以用它做世界杯周边商城,把商品页、素材、收款和订单流程快速串起来。也可以做交规学习产品,把内容流量和私域转化接起来。也可以做本地服务入口,让用户看服务、提交需求、完成支付。 也可以像我这样,做一个 Web3 事件检测、头部账号信号追踪、Polymarket 交易辅助工具。 这些需求都有一个共同点很垂直,很细分,很贴近真实生意。它们不一定需要一个庞大的技术团队,但需要一套能快速上线、持续修改、直接承接收入的执行流程。 这正是 xBubble 适合 OPC 的地方。 一个人或者一个小团队,只要知道自己要服务谁、抓什么信号、卖什么产品、怎么完成交付,就可以用 SOP 把业务搭起来。 更重要的是,xBubble 不是只有固定模板。成熟场景可以直接用现成 SOP 快速启动,新的细分需求则可以通过 Bubble Engine 继续生成更贴合场景的专用 SOP。 这点对 Web3 特别重要。因为这里的机会变化很快。今天可能是头部账号互动。明天可能是 Polymarket 事件变化。后天可能是某个钱包行为。下一轮又可能变成社区积分、空投任务、链上数据面板。 如果工具只能做一种固定场景,空间会很有限。但如果 SOP 可以跟着新场景继续生成,个人和小团队就能把自己的细分判断,不断沉淀成新的业务流程。 我这次搭头部账号和 Polymarket 事件监控,就是一个很小但很具体的例子。它把我平时刷推、盯盘、查币、看钱包、看事件赔率的动作,变成了一条可以自动跑的流程。 以后我想加新的账号源,可以继续扩展。想换策略匹配规则,可以继续调整。想把简报字段做细,也可以继续改。想接更多链上动作,也能继续往后接。 这才是 OPC 时代 AI 工具真正该有的样子。不是让个人去模仿大公司搭团队,而是让个人用 SOP 获得接近专业团队的执行能力。 内容自动生成、多平台宣发、稳定币结算、链上任务执行、客户承接、后台管理,这些原本需要多人协作的环节,被压缩进一套更轻的业务系统里。 所以我现在看 xBubble Coding,已经不只是把它当成 AI Coding 工具。它更像是给个人创业者和小团队准备的业务启动基础设施。 对我来说,头部账号互动不再只是一个我刷到之后才处理的信息点。Polymarket 事件变化也不再只是一个我想起来才去看的页面。它们都可以变成自动进入系统、自动筛选、自动整理、自动触发后续流程的策略输入。这类细分需求过去很少有人专门做,因为太个人化、太垂直、变化也快。 但 xBubble 的 SOP 思路,刚好适合把这种需求做成可以低成本验证、持续迭代、甚至沉淀成服务的东西。这可能就是它最值得看的地方。AI Coding 的上半场,是让更多人可以做出应用。 xBubble 想做的下半场,是让这些应用真正变成能跑业务、能接收入、能持续迭代的商业流程。对 OPC 来说,这比一个好看的 Demo 重要得多。

币圈荒木|Araki🪵

30,150 просмотров • 2 месяцев назад

我最近一边写内容,一边在验证一个问题: 如果要做一个面向 AI 创作者的小工具,到底该做什么? 直接问 AI“给我想个产品 idea”,意义不大。 它能给你 20 个想法,但不代表有人愿意付钱。 我最近用 Airtap Ai Airtap 跑了两个任务。 第一个很简单。 我给一个真实的美国号码发了一条 iMessage: +1 (650) 248-0054 “在 X 上帮我查一下今天最热的 AI 信息和话题。” Airtap 收到消息后,直接操作云手机里的 Chrome,打开 X 搜索。 我不用守在页面前,它会通过 iMessage 回传进度: “正在查看 Grok 4.6,整理高互动帖子。” “已经拿到 Grok Imagine 的数据,接下来检查 Claude 工具。” 过了一会儿,热点、原帖链接和互动数据就发回来了。 这个任务很适合做内容的人。 它像一份每日选题雷达,解决的是: 今天有什么值得写? 哪些海外话题可以转成中文内容? 并且它的入口非常方便,一项任务交给一条imessage就可以搞定。 但我还想解决另一个问题: 如果我要做一个服务 AI 创作者的产品,哪些问题真的值得做? 这次我在 Airtap 的 Web 端发了一个更长的调研任务: 去 Reddit 和 X 找 AI 创作者已经花钱、却仍没解决的问题。 我只保留四类讨论: 买过多个工具,问题还是没解决; 已经雇人或购买过服务; 每周仍要投入大量人工时间; 因为价格、功能或稳定性反复换工具。 同时要求它记录原帖、评论、链接、已经尝试的方案和实际成本。 任务跑起来后,我会在 Web 端看它执行: 搜索了什么关键词,打开了哪些帖子,有没有进评论区,又怎样切到 X 做交叉验证。 这一步对我很重要。 我要的是能回头核对证据,而非一份看起来很厉害的 AI 总结。 最后拿到的是一份付费痛点机会表。 其中有两个结论让我印象很深。 第一个是多工具订阅。 不少重度用户同时订阅 GPT、Claude 和一堆垂直工具,每月花费超过 100 美元,但依然搞不清额度、频繁遇到限流,还要处理支付和区服问题。 他们缺的不是又一个模型。 更像是一个能看清“钱花到哪、额度还剩多少、哪个工具该留”的管理层。 第二个是 AI 内容返工。 有些创作者已经付费买了生成工具,但内容出来后,还是要花大量时间改脚本、核对事实、去掉 AI 味。 他们要的也不是更多的生成。 而是把内容变成“能发、可信、像自己”的最后一步。 这份报告没有告诉我“做这个一定能赚钱”。 但它让我排除了一个方向: 我没必要再做一个 AI 内容生成器。 反而可以先验证一个更小的产品: 帮重度 AI 用户看清订阅、额度和重复支出。 下一步,我会把这个痛点做成一页简单的产品说明,找 10 个同时订阅 GPT 和 Claude 的创作者聊聊。 如果有人愿意给出自己的账单和额度使用情况,再做 MVP。 这就是 Airtap 给我的第二个结果: 不是帮我找到一个“看起来很酷”的点子。 而是帮我找到一个有公开证据、有付费行为、能继续访谈验证的产品方向。 如果这类调研想要长期做,还可以保存成 Routine,每天自动追踪 Reddit 和 X 上新出现的付费痛点,不用反复发同一段 Prompt。 我现在理解的 Airtap 工作流很简单: 临时内容任务,直接用 iMessage 发出去; 复杂调研任务,打开 Web 看过程、核对证据; 值得长期追踪的方向,再保存成 Routine。 完整调研报告和执行过程放在视频里。

木马人

43,659 просмотров • 1 месяц назад

我用掉 100 亿 Token 后,最大的变化不是更会写 Prompt。 而是 Codex 已经从一个聊天框,慢慢变成了我的: - 自我认识系统 - 工作系统 - 信息系统 - 学习系统 - 甚至是桌面陪伴系统 我把自己最常用的 20 个技巧整理出来了。 如果你也想把 AI 从“偶尔问一句”变成真正能长期协作的伙伴,建议先收藏。 一、让 Codex 逐渐认识你 1. 每天让它问你一个问题 我设了一个自动化:每天问我一个能帮助它更了解我、也帮助我认识自己的问题。它会避开已经问过的话题,围绕一个主题慢慢聊。 2. 把对话当成自我观察 现在可以直接语音聊。长期积累下来,它能看到我的情绪、偏好、反复出现的困扰和思考方式。 3. 让它把“它眼中的你”画出来 把你们的对话和一张漫画参考图交给它,让它生成多格漫画。你会发现:很多时候我们要的不是答案,而是被理解。 二、把 Codex 变成工作系统 4. 每周做一次 Codex 使用复盘 让它回顾这周我怎么使用它、哪些沟通方式有效、哪些任务返工了、哪些项目该继续推进。 5. 把失败经验写进“第二大脑” 不只是存笔记。把失败原因、偏好、最近关注点沉淀下来,让以后不同 Agent 都能调用同一份上下文。 6. 创意任务先开 Plan Mode 创意型工作最容易“没想清楚就批量执行,最后返工”。先用计划模式讨论目标、方案、数据体系和风险,再开始做。 7. 把 Codex 当思考顾问,而不是执行员 你甚至不需要有明确答案。只要说“我想做什么”,让它帮你一起把模糊的想法拆成可执行路径。 8. 需求清楚后切到 Goal Mode 需求确认后,把结果设成目标,让它自己持续推进。我的任务最长跑过 10 小时 44 分钟。 9. 用自动化处理重复但重要的事 日报、周报、账号监控、邮箱监控、回复策略、内容归档、同步到个人网站——这些都适合交给自动化。 10. 明确任务就开多 Agent 对于翻译、多语言网站、图片生成、资料整理这类边界清晰的工作,让多个 Agent 分工并行,比一个人盯着快得多。 三、让 Codex 跨出聊天框 11. 用 Sites 一键分享作品 做好网站后,不要卡在“怎么部署”。Sites 可以直接把成品变成能分享的站点。 12. 把插件当成能力扩展包 Computer Use、数据分析、Investment Banking、GitHub、Outlook / Gmail……很多工作不是“AI 会不会”,而是你有没有给它接上正确的能力。 13. 把生图能力接进日常工作 我已经用它生成了 300 多张图。做内容、配图、产品原型和视觉探索,速度会完全不一样。 14. 接入飞书,让手机也能操控 Codex 真正高频的协作不该只发生在电脑前。把它接到飞书后,我在手机上也能下任务、收结果、继续对话。 15. 用 ChatCut 把剪视频变成工作流 不是只让 AI 帮忙剪一刀,而是把素材整理、脚本、配图、剪辑一起接进创作链路。 四、建立自己的信息雷达 16. 每天订阅 Builder 信息 我会用 Follow Builders Skill 定时追踪 Builder 的新想法、新产品和讨论,再把重要信息推送给自己。 17. 做一个“灵感箱” 任何一闪而过的想法都丢进去。后面让 AI 自动搜索、补充背景、分类、处理,而不是靠脑子记住。 18. 盯住 GitHub 和 Product Hunt 让 Agent 帮你筛新项目、周榜、日榜和真正值得试的工具。看见感兴趣的,直接让它安装或进一步研究。 五、把输入变成你的输出 19. 把任何学习材料做成 HTML 学习页 看到一场好访谈、一个视频、一篇文章:让 AI 拉取内容、生成中文文字稿,边看边记评论,最后再变成摘要或短视频。 20. 给 Codex 一个“实体感”:做成桌宠 我很喜欢 Hatch Pet。它会根据状态跑动、办公、提示待办,甚至在你切换文件夹和工作区时给建议。AI 不一定要冷冰冰地躲在聊天框里。 100 亿 Token 给我最大的启发是: 不要把 AI 只当作“问答工具”或“临时外包”。 当它拥有你的上下文、目标、工作流和反馈后,它会越来越像一个能长期协作的系统。 换电脑时,我第一个装的软件就是 Codex。 写文档、做网站、剪视频、找资料、整理灵感……它已经覆盖了我工作和生活里非常大的一部分。 你最想让我把上面哪一条展开成教程? 评论区告诉我,我下一条就拆! #codex #chatgpt @thsottaux

Vivi Xiao

105,608 просмотров • 2 месяцев назад

【Plus订阅用户——无限额度的神级工具】 Plus 的 Codex 5 小时额度完全不够用? 先别急,交给这个神级工具,让你的plus额度也够用 很多 Plus 用户不是不会用 Codex,而是把规划、执行和审查全塞给 Codex,让它变得太“全能”。 先让它通读仓库、自己想方案,再写代码、跑测试,最后还要重新读取全部上下文,审查自己刚才做过的改动。 等到 5 小时额度窗口开始紧张,真正需要 Codex 动手的工作,可能才刚刚开始。 如果你也经常觉得 Plus 的 Codex 额度不够用,我更建议先优化任务分工,而不是继续压缩提示词,或者把所有步骤都塞进同一次调用。 我现在使用的工作流是 Codex with ChatGPT: ChatGPT → PLAN Codex → EXECUTE / TEST ChatGPT → REVIEW 简单来说:ChatGPT 负责把问题想清楚,Codex 负责把改动做出来。 第一步是 PLAN。 在进入 Codex 之前,先让 ChatGPT 网页版明确: • 这次到底要解决什么问题? • 哪些内容属于本次范围,哪些明确不改? • 可能涉及哪些文件和依赖? • 需要运行哪些测试? • 什么结果才算完成,出问题怎样回滚? 计划至少要回答这五件事:改什么、不改什么、碰哪些文件、怎样测试、什么结果才算完成。 没有边界的“帮我优化一下整个项目”,往往才是最消耗额度的用法。 第二步是 EXECUTE / TEST。 规划完成后,再把清晰的施工单交给 Codex。此时 Codex 不需要重新做一轮开放式研究,而是专注它最擅长的本地工作: • 编辑文件 • 运行 Shell 和项目命令 • 使用 Git 检查改动 • 执行测试 • 根据真实错误继续修复 给 Codex 的不再是一道没有边界的研究题,而是一项可以直接执行、可以测试、可以验收的任务。 一轮调用最好只有一个明确闭环: 修改 → 测试 → 报告结果 第三步是 REVIEW。 代码完成后,我不会只让执行者重新通读整个仓库,然后告诉我“看起来没问题”。 ChatGPT 会通过只读连接,按需查看相关文件、diff 和测试记录,再从原计划出发做一次独立审查: • 改动有没有超出范围? • 测试是否真的覆盖了目标? • 有没有隐藏失败或未经验证的结论? • 文档、实现和最终结果是否一致? 只有发现具体问题时,才向 Codex 发回最小修复任务。 这套分工的关键不是让两个 AI 重复干活,而是让每一层只负责自己最合适的事情。 在当前这个视频工程里就有一个真实例子:ChatGPT 审查时发现首帧工作台遮挡了标题;Codex 随后把 `.workspace` 的位置从 `top:128px` 调整到 `430px`。基线检查有 10 个重叠错误,修改后 Layout 变为 0 issues,最后再由 ChatGPT 读取事务 diff 和验证记录完成复核。 这就是完整闭环: 发现问题 → 明确修改 → 本地执行 → 运行检查 → 独立复核 对于 Plus 用户,这套方法最直接的作用,不是把官方额度变多,而是减少 Codex 执行通道里的重复阅读、开放式探索和自我复盘。 普通任务可以先在 ChatGPT 网页版锁定范围,再让 Codex 本地执行;完成后,只让审查层按需读取必要的 diff 和测试记录。这样能把更宝贵的 Codex 调用留给真正需要编辑、命令和测试的步骤。 如果你是 Pro 用户,还可以把最困难的架构规划、跨文件风险分析和最终审查,交给 ChatGPT 网页版中最高能力的 Pro 模型选项;复杂推理由 Pro 负责,本地执行仍由 Codex 完成。具体模型名称和开放范围可能调整,以你账户里的模型选择器为准。 需要说明的是: 这不是增加官方额度,也不会解除 5 小时窗口,更不是绕过平台限制。 它做的事情更朴素:不再让 Codex 同时扮演产品经理、架构师、程序员和审计员,而是让每一次调用都有明确范围、明确任务和明确验收标准。 Codex with ChatGPT 使用只读连接,按需读取完成规划和审查所需的工作区内容;不是一次性上传整个仓库,也不会把写文件、删除文件或执行 Shell 的权限交给 ChatGPT。 如果你也在用 Plus,最近又经常撞到 5 小时额度限制,可以试试先把任务分工做好,再开始下一次编码。 项目地址: 安装后可以直接对 Codex 说: “使用 Codex with ChatGPT 完成首次配置并应用。” #Codex #ChatGPT

18168

34,355 просмотров • 1 месяц назад

到现在都难以相信,Apodex 居然开源了!! 我一度认为非常有商业价值的产品! 还记得第一次用它,惊艳程度不亚于我第一次用Manus! 这次,Apodex 开源正式发布了新版本 Apodex 1.1, 并且提出了一个我非常认可的概念: AI的能力单位,不应该是一次回答,而应该是一项完整任务。 什么意思?一个AI真正想进入工作流,至少要做到几件事: 理解目标、进入真实环境、维持长任务状态、根据中间结果不断调整计划、任务失败后修复、最后交付一份可以核查的成果。 最近刚好在做一个AI项目,是一个工作台,需要评估不同模型组合选型的成本, 为了测试Apodex能做到什么程度,我把模型价格、评测数据和具体场景需求给到它,让它根据我的需求,为四类业务场景完成 AI 模型/API 选型,统一不同厂商的价格口径,计算月度成本,同时满足性能、上下文、工具能力、预算和供应商集中度约束。 它拿到的是不同格式、不同统计口径的数据,有些数据可能不够准确,有些需要清洗,有些需要重新计算。 Apodex没有上来就写报告,它先在Task Board里拆解整个任务,然后根据任务自动组织Agent Team。 第一轮,它已经完成了数据清洗、价格标准化、模型筛选和成本测算, 然后我临时补充了新的需求: 没错,在任务中我可以随时“插话”,补充新的文件和想法。 *中文内容生成的月请求量,从 12 万提高到 24 万; *深度研究中 30% 的场景,必须转到自建环境; *长文档审阅全部涉及敏感文件,也必须本地运行; *月预算不变; 普通AI看到这一堆新的需求,一般都会重新跑一遍。 但Apodex并没有!它保留了原始数据、价格归一化方法、峰谷计价规则和已经验证的计算口径,没有变化的部分原样保留,只是重新调整了变化的部分! 它可以在任务过程中动态调整任务计划!! 这个可能是这个版本最大的一个更新!Apodex 1.1 就像是在维护一个持续变化的任务状态: 它要读取真实文件、拆解工作、推进计算,还要接收中途反馈,判断保留仍然成立的成果,只修正受影响的部分,最后把结果交付成可以继续使用和核查的文件。 这可能才是复杂任务型 Agent 真正应该具备的工作能力。 最后,它交付了两份不同粒度的报告,以及一个包含 18 个工作表的 Excel 成本模型;其中专门新增了“变更与场景”“云 API 重算”“本地候选筛选”“本地 TCO 缺失假设”“保留 vs 受影响”5 张表。 整个过程,特别丝滑。 这也是Apodex 1.1这次最核心的变化:进入真实任务的执行过程。 而所谓真实任务的执行,其实就是你随时可以甩给AI新的资料和要求,而它会有条不紊的把任务进行下去,直到交付给你完整可验证的结果!

沐阳

50,138 просмотров • 1 месяц назад

我折腾了Openclaw大概有一周了吧,感觉这一周也不能说时时刻刻在玩,但是确实已经让我体验到了他的很多优点和坑。 我觉得这个坑其实也并不是他的缺点,而且初学者在使用的时候没有注意到的特点,本文会好好聊聊。虽然有人说它不是什么高深的科技,但是Openclaw确实解决了我一个很长时间都没有人来解决的痛点, 作为一个web3的博主,我平常有很多零碎的时间,在外的时候,开车的时候,参加活动的时候,加起来其实非常多,一周下来能有十几个小时。 这些时候其实我的脑子都不处于idle的状态,而是经常想写东西。比如我经常就会抽个十分钟走路,边走边把我的一些想法和GPT录入,然后生成文章或者笔记,甚至是代码。 但对于有些问题,比如验证一个交易的想法,产品的想法,用一个我已经开发好的脚本去了解市场行情,缺少一个主机这样强大的工具来帮我落地。 也就是说,哪怕AI给了我方向,给了我代码,最后去跑的,还是我啊! 我这不是给AI打工了吗? 于是在知道了Opencalw这个东西的五分钟之后,我就边开车边在手机上下单了一个全新的MacMini,准备开始改变人生 我觉得玩了一周下来,我做到了。我可以躺在床上刷剧和喝啤酒的同时,让全市场行情尽收眼底,有一说一,minimax真的很稳定且偶尔会让人觉得惊艳。 刚丢给他anthropic和五角大楼的八个新闻,他给我做了系统性总结并归档,语言风格也非常自然,确实不是对话框可以体验的,但有在对话框环境里搞定了看黑漆漆IDE才能做到的aget效果,且效果很棒。这就是openclaw框架的特点。 接下来重点聊聊 #Binance 最近更新4个 AI skills 技能 Alpha 市场数据、U 本位合约、杠杆交易、资产管理。在我看来,这次更新的重点不只是“功能变多了”,而是 OpenClaw 终于更像一个能真正配合你做事的交易助手了。 以前我们用这类工具,更多还是停留在“查数据、看行情、问问题”这个层面,信息是有了,但真正做决策、盯条件、执行动作,还是得自己一步步来。现在不太一样了,你只需要说出自己的意图,它就能把筛选、判断、执行这些动作尽量串起来。 这 4 个技能里,我最看重的是资产管理。因为它解决的不是“看什么”,而是“钱怎么动”。比如现货和合约之间的划转、账户余额整理、碎币换 BNB,这些以前都很零碎,但实际又很高频。现在如果能交给 Agent 去处理,整体体验会顺很多。 另外,Alpha 数据、合约、杠杆这几个技能组合起来后,确实会让很多交易思路更容易落地。比如监测异动、看资金费率、设置止盈止损、按条件执行下一步,不用自己频繁切页面、算逻辑,效率提升会很明显。 不过我自己的看法是,这套skills最有价值的地方,不是“自动赚钱”,而是把原本复杂、重复、容易出错的操作流程对话化了。它更像是帮你提高执行效率,而不是替你承担判断和风险。 而且目前币安中文社区正在举办 “用 AI 建设加密,搭建币安主题 AI Agent” 的活动。 总奖池:48.6 BNB(作品奖44 BNB + 推荐奖4.6 BNB)。 作品奖:第1名10 BNB、第2名8 BNB、第3名6 BNB、20名优胜各1 BNB。 对普通用户来说,参与重点可以概括为一句话:不用非得做得特别复杂,能跑通、能演示、逻辑清楚,就有机会拿到奖励。赶快行动起来吧,部署一只属于你自己的龙虾,改变人生的轨迹。 为此专门做了一个接入视频,希望能帮助到大家一起建设起来~ 币安技能中心传送门: 部署龙虾碰到问题可以dm我或者评论区留言,欢迎老师们多多交流~

百里 🦅

16,721 просмотров • 6 месяцев назад