Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

Anthropic 发布了 Skill Creator 的重大更新 核心变化:内置测试用例生成 写完一个 Claude 技能,怎么知道它到底能不能被正确触发?以前靠手动试,现在 Skill Creator 内置了测试功能,帮你自动跑评估。 你现在可以给技能定义一组测试提示词,描述"什么样的回答算合格",然后让系统自动跑测试、出报告。 不需要写代码,不需要搭测试框架。 具体新增了四个能力: 自动化评估(Evals): 定义测试提示词和预期结果,系统自动运行并追踪通过率、耗时、token 用量。当模型更新或基础设施变化时,你能立刻发现技能是否"退步"了。 多 Agent 并行测试: 测试用例不是排队跑的,而是在独立的 Agent 中并行执行,每条测试互不干扰,各自有独立的 token 和耗时统计。 A/B 对比: 系统用"比较器 Agent"对两个版本的技能做盲测对比,去掉主观偏见。你改了技能描述,想知道新版比旧版好还是差,直接跑一轮对比就有答案。 触发率优化: 这可能是最实用的功能。系统会分析你的技能描述和测试提示词,建议怎么改描述才能减少误触发和漏触发。官方测试中,6 个公开的文档类技能有 5 个的触发准确率得到了提升。

46,969 Aufrufe • vor 5 Monaten •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

Anthropic推出了一项新功能,叫做“提示词改器”(Prompt Console)。 Claude 会使用思路链推理等提示工程技术自动对提示词进行改进,优化你的提示词,让AI的回答更准确、符合预期。 这项功能的主要作用: 1. 自动优化提示词:通过提示词改进工具,开发者可以让Claude模型自动优化现有的提示词(即向AI模型提出的问题或要求),以提高模型回答的质量。例如,工具会增加一个“链式思维”环节,让Claude在回答之前先有条理地思考问题,确保回答更精准。 2. 标准化和丰富示例:工具可以把提示中的示例转成统一的格式,比如XML格式,这样Claude更容易理解和处理。 3.示例增强:对现有示例进行自动补充,使其与结构化后的提示更加契合,包括增加链式思维的逻辑过程。 4.重写:对提示进行重写,明确其结构,并纠正小的语法或拼写错误,以提高提示的质量和易读性。 5.预填充:在Claude的助理消息中预填充内容,帮助引导Claude的行为,并确保输出格式符合需求。 一旦新提示生成,你还可以向Claude提供反馈,说明什么有效,什么不起作用,以进一步改进提示。 实际效果:根据Anthropic的测试数据,使用提示词改进工具后,模型的准确率在多标签分类任务中提升了30%,并且在摘要任务中能够100%完全遵循字数要求。

小互

39,813 Aufrufe • vor 1 Jahr

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

26,998 Aufrufe • vor 2 Monaten

Codex 5.6 真正与普通人拉开 90% 差距的,不是 prompt,而是你会不会配置 config.toml 很多人用 Codex 还停留在“打开就聊”,但真正重度使用的人,早就把模型、任务模式、项目规则和自动化流程写进配置里了。 现在 Codex 5.6 最值得折腾的 4 个专业设置: 1️⃣ 固定模型 + Reasoning Effort 别每开一个任务都重新选模型。 把默认模型和推理强度写进 ~/.codex/config.toml,日常任务追求速度,复杂架构任务再提高 reasoning effort。 输入prompt: 请检查我当前 Codex 5.6 实际支持的模型和 reasoning effort 配置,不要猜测或使用已经废弃的参数;然后修改 ~/.codex/config.toml,为日常 Coding 设置合理的默认模型与推理强度,并告诉我具体修改了哪些字段、为什么这样配置,最后验证配置是否成功生效。 2️⃣ 不同任务建立 Profile 写功能、修 Bug、Code Review、做系统架构,根本不应该用完全相同的配置。 Codex 支持 Profiles,可以针对不同任务切换不同工作模式。 配置用的prompt,直接用: 请基于我当前 Codex 5.6 配置创建 3 套 Profile:fast-dev 用于快速开发和小修改,code-review 用于 PR 和代码审查,deep-architecture 用于复杂系统设计;分别配置合适的模型、reasoning effort 和执行策略,不使用已经废弃的配置项,并告诉我之后如何通过 --profile 切换使用。 3️⃣ 给每个项目建立独立配置 全局配置解决“你习惯怎么工作”,项目配置解决“这个项目必须怎么工作”。 把技术栈、测试方式、项目约束和工具配置放进项目自己的 .codex/config.toml,不要每开新会话都重新解释。 直接输入: 请分析当前项目的技术栈、目录结构、测试方式和开发工具,为这个项目设计一份最小化的 .codex/config.toml,只写当前项目真正需要的配置,不覆盖无关的全局设置;完成后解释每项配置的作用,并检查项目级配置是否能够被当前 Codex 正确加载。 4️⃣ 用 Hooks 把规则变成自动执行 最浪费时间的方式,就是每次都提醒 Codex 改完记得跑测试、提交前记得检查、别忘了扫安全问题。 现在可以直接把这些规则做成 Hooks,在生命周期节点自动触发。Codex 当前官方配置已经支持 lifecycle hooks。 直接用这段: 请检查当前项目适合配置哪些 Codex lifecycle hooks,并为我建立最精简的一套自动化流程:代码修改完成后运行必要测试和 lint,关键变更执行安全检查,提交前执行最终验证;只配置真正必要的 Hook,避免重复执行和拖慢开发速度,完成后实际触发一次并验证每个 Hook 是否正常工作。 真正高效的 Codex 启动就知道该怎么工作。 赶紧配置试试吧!

govin.eth | G哥

151,987 Aufrufe • vor 12 Tagen

🚨🚗 德州奥斯汀街头实测曝光:$TSLA Robotaxi 已在真实道路运行 奥斯汀被发现出现网约车形态的 $TSLA 自动驾驶车辆。不是封闭场地、不是展示路线,而是真实城市路网中的测试运行。 更关键的是,这并非单点事件。 目前已有 10+ 台 Cybercabs,在 4 个州同步推进测试,意味着这套系统已经进入跨区域一致性验证阶段。 这一步的信号很清晰: 测试重点不再是“能不能跑”,而是规模化前的稳定性与监管可复制性。 为什么选奥斯汀? 因为这里既是 $TSLA 总部所在地,也是美国自动驾驶监管相对友好、道路结构复杂度适中的城市。 如果能在这里稳定运行,向其他州扩展的摩擦成本会明显下降。 从节奏上看,这更像是Robotaxi 商业化前的“静默推进期”: 不大规模宣传,但在真实场景中持续喂数据、压系统、磨边界条件。 市场接下来会盯三件事: 第一,是否出现固定时段/固定区域的常态化运行; 第二,是否与本地监管出现明确的合规信号; 第三,测试车辆数量是否继续上升,而不是停留在象征性规模。 这不是一次新闻点,而是一条长期曲线的中段节点。 真正的变量不是“有没有 Robotaxi”,而是什么时候从测试跃迁到可收费运营。 如果你现在回头看,会把这视为一次普通测试, 还是 $TSLA Robotaxi 商业化前的关键过渡期? 📬我会持续跟踪 $TSLA 在自动驾驶与 Robotaxi 路线上的关键进展,拆解从测试到规模化的真实信号,而不是只看发布会。 $TSLA #Tesla #Robotaxi #AutonomousDriving #FSD #Austin #EV #AI

Wealth Code

21,786 Aufrufe • vor 7 Monaten