Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

可能很多人不知道,你跑过的Claude Code会话本身就是值钱的训练数据 EvoTrace,刚开源两天冲了90星,把躺在你机器里的Claude Code和Codex历史会话,编译成偏好数据、可回放评测任务和RL环境 四个agent串行评审每段会话,证据不足直接拒收,防止长而弱的轨迹混进训练集 本地优先,源数据和产出都在你自己手里,Apache开源 macOS、Linux、Windows一行脚本就能装,Claude Code和Codex用户开箱即用

16,259 Aufrufe • vor 1 Monat •via X (Twitter)

0 Kommentare

Keine Kommentare verfügbar

Kommentare vom Original-Post werden hier angezeigt

Ähnliche Videos

有人靠金融市场模拟,在链上赚了 $400,000 而且用到的整套工具,都是 GitHub 开源 能看到的钱包在这,自己点开看: 他们做的不是 crypto 原生叙事 而是拿 Russell 2000、Dow Jones、SPX、Apple、Google 这些传统金融标的来做 Polymarket 交易 问题也很现实: 这些数据平时都在大型中心化交易所里。 你怎么拿? 拿到之后又怎么处理,才能真的变成可交易模型? 这套公开出来的技术栈,大概是这样: 1)Financial Datasets MCP Server 给任意 ticker、任意时间周期提供价格数据解析。 核心卖点就是:免费真实数据。 GitHub: 2)MiroThinker 一个偏深度研究和预测的 agent。 据说在 BrowseComp benchmark 上做到 88.2。 特点是: 长周期推理 先验证再下结论 步骤级 + 全局级校验 单任务最多可调用 300 次工具 它的作用不是直接下单。 而是先通过 MCP Server 拉数据, 把研究、清洗、验证这些环节跑完, 最后整理成可以直接用于模拟的数据集。 GitHub: 3)MiroFish simulation system 把前面准备好的数据丢进去, 再设定模拟参数, 就可以开始跑价格行为模拟。 本质上,它卖的不是一个指标。 而是一种更接近“矩阵视角”的东西: 价格在不同条件下会怎么动 哪些路径更常见 哪些定价其实偏离了历史结构 整个流程串起来就是: 拉传统金融历史数据 → 用 agent 做研究和数据整理 → 把数据送进模拟系统 → 再拿结果去打 Polymarket 上的相关市场 这种玩法最值得看的,不是“开源”两个字 而是它说明了一件事: Polymarket 上很多看起来像事件交易的东西,背后其实已经在被人用传统金融数据 + agent 研究 + simulation当成量化问题来做。 你觉得这种 edge 的核心,更像是数据获取能力,agent 研究能力,还是最后那层 simulation 对市场行为的还原能力?

0x_Miko

23,818 Aufrufe • vor 6 Monaten

Grok Build 开源了,开源 harness 时代终于要来了吗?! Claude Code 现在还是闭源, 反而显得有点被动了🤔。。。 不愧是Elon,真是一步妙手啊,只用了四天完成信任崩塌到重建,xAI这次用开源把隐私危机打成了生态先手,看来并不是草台班子😂 被爆全量上传代码仓库的隐私风波还没平息,SpaceXAI直接把整个Grok Build的agent harness全部开源出来, 这事我觉得有意思的地方是两它为什么是今天开,而不是上个月? 上个月 Grok Build 以 beta 上线,SuperGrok / X Premium+ 用户能用一个终端原生的 coding agent。 Plan Mode 先出计划让你审核,Subagents 并行拆任务,底层 Rust 写的,架构干净。 然后上周出了件事, 一个研究员做 wire-level 分析发现,Grok Build CLI 会把整个 git repo——包括历史、包括潜在的 secrets——打包上传到 Google Cloud bucket。隐私开关只管“是否用于训练”,不管传不传。 讲真这事对 coding agent 是致命的。 因为 coding agent 的 harness 对文件系统有近乎上帝视角的访问权。 你的 IP、商业逻辑、没公开的项目结构、不小心留在 git history 里的 key——它全看得见。 宣称“我们不看你数据”没用,用户要的是能自己验证“你没在看”。 时间线很紧凑: 7 月 11–14 日,争议发酵,研究员曝光上传行为。 Elon 表态删数据、服务端关闭上传。 7 月 15 日,开源公告 + 重置 limits + 默认关闭 retention + 删掉所有之前保留的 coding data + 提供 bug bounty。 所以这次其实不是一次计划好的例行开源。更像是被争议倒逼的快速应对。 但 xAI 做得聪明的地方是——它借这个机会做了一件事:把“harness(连接层)”和“model(大脑)”切开了。 Harness 开源,Apache 2.0,社区可以审计、fork、改掉上传逻辑、加 sandbox、接本地模型,Model 和 API 还是闭源的。 这个配置——闭源模型 + 开源 harness——正在变成 2026 年 agentic coding 的主流。 OpenAI 的 Codex CLI 走的同一条路,Anthropic 的 Claude Code 现在还是闭源,反而显得被动了。

AYi

34,063 Aufrufe • vor 2 Monaten

最近在 GitHub 上刷到一个挺炸的开源项目:Wren AI 它本质上是在做一件我们都很熟、但一直没被真正解决好的事:让不懂 SQL 的人,也能自己查数据库。 比如说,业务、运营想看数据,第一反应就是来敲后端:“帮我查下上个月销量前 3 的产品”“这个转化率能不能按渠道拆一下”。 SQL 本身不难,但沟通成本、来回确认、临时插队,才是真正耗时间的地方。 Wren AI 的思路很直接:对话即查询。 你直接用自然语言问问题,它会自动生成 SQL、跑库、给结果,甚至顺手把图也画好(柱状图、折线图那种)。 可以把它理解成一个 “自带 AI 分析师的开源版 Metabase”,但门槛更低,不用拖字段、不用写 SQL。 比较关键的一点是,它不是那种“裸 Text-to-SQL”。 Wren AI 引入了 Semantic Layer(语义层),你可以提前把业务指标、表关系、口径定义清楚,相当于给大模型加了一层“业务护栏”。 这一步虽然需要懂数据库的人前期配置一下,但一旦理顺,后面业务方基本很难把数据问歪,准确性和安全性都高很多。 模型和部署这块也挺对技术人的胃口: ·云模型:OpenAI / Claude / Gemini 都能接 ·数据不出内网:可以配 Ollama + 本地模型(比如 DeepSeek) ·数据库支持也很全:MySQL、Postgres、ClickHouse、DuckDB 基本全覆盖 ·安装也不折腾,有 Docker 基本就是一键起 整体看下来,我觉得它特别适合两种场景: 1)想给团队搭一套真正能用的自助查数平台 2)想研究 “AI + BI + 语义层” 这种更偏工程化的落地方案 一句话总结:把“查数据”的自由还给业务,把时间还给开发。

sitin

30,152 Aufrufe • vor 7 Monaten

Notion 今天凌晨发了一个开发者平台, 大家都以为它在追 AI Agent 风口, 但实际方向是有些反过来的, 它要让所有 Agent 来追它, 我盯着它官方文档里那个新的 CLI 工具看了一会儿,才慢慢回过味儿来, 这个 CLI 设计得很奇怪, 它自带 --help,自带 --docs,自带 --spec, 每个命令的元信息都精简到极致,token 占用低到反常, 说实话人类开发者用 CLI 哪需要这些, 熟了就肌肉记忆,谁会反复读自动生成的 spec 呢, 但 Agent 会啊,它进入一个陌生 CLI,要先扫一遍能干嘛,扫的就是这些自描述信息, 也就是说,Notion 这个 CLI, 从设计的第一天起就不是给人用的, 是给 Agent 用的, 他们官方话术更直接:说和你的 coding agents 一起构建, 这一句话翻译过来就是,未来用 Notion 的主力用户, 可能不是你,而是是你的 Agent, 更狠的是这套基础设施的完整度,数据同步,Notion 托管, 工具调用,Notion 托管,Agent 沙盒,Notion 托管, 全跑在 Vercel Sandbox 加 Firecracker microVM 上, 连第三方 Agent 接入都开了, Claude 直接进来,当原生工具用, 数据,工具,编排,上下文,全部在同一个 workspace 里,零损耗, 以前 Agent 最大的痛点,是上下文碎片化,工具调用不稳定,自己还要搭一套 infra, 现在 Notion 把这套东西全包了, 你的 Agent 只需要醒过来,在一个已经布置好的房间里干活, 很多人还在评估 Notion 涨没涨价,还在讨论 Obsidian 迁移和本地优先, 但真正的故事是,Notion 已经在 Agent 时代的操作系统这条赛道上,把第一块地基浇好了 数据是血,Agent 是肌肉,Workers 是骨骼,CLI 是神经, 那些现在就把核心 workflow 搬进去的人, 和还在纠结要不要试用 ntn 的人, 未来 12 个月,差距可能比想象中要大得多。

AYi

19,811 Aufrufe • vor 4 Monaten