Loading video...

Video Failed to Load

Go Home

最近深度使用了一下 Kimi 3,所以对这个模型的真实编程能力有一定的发言权,正好有做一个录屏软件的需求,之前也说过市面上现在有很多,但是我想按照我的需求深度自定义一个,用来测试一下 Kimi3 的实力,因为这个 case 还是比较复杂的,React UI界面,Rust 核心 以及Swift bridge,录制可靠性以及复杂的编辑和交互等等。 在使用过程中还是挺惊艳的的,从出 plans,到执行,再到自动化验收,启动数个 sub agents,完成平行任务,几个大任务 多 agent 并行连续执行了 5 - 6 个小时,1M 的上下文非常够用,300多个自动化测试,整个过程我就是在交互指导和验收过程中进行过几次微调。 最终按照 plan 实现了几个关键功能的 demo,录入屏幕,摄像头 和音频,可以自动记录点击和输入事件,可以实现自动 zoom,可以实现导出不同的尺寸,不同画框的尺寸拖拽,可以支持多种背景,纯色渐变和系统壁纸,虽然现在 UI 还没有打磨,但是基本功能都实现了。 如果对比一下的话,整体感觉差不多是 Opus 4.8 和 5.5 持平,部分场景有些 5.6 Sol 的感觉,我之后应该会长期使用一下持续关注效果。

28,940 views • 20 days ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

Claude Fable 5 重新开放了 最近刚好有一个demo,就是看能不能用顶级模型做一个meme工厂 “ 就是我输入一个 Meme Coin 创意 然后这个工具自动生成品牌 / 叙事 / 经济模型 / 营销方案 支持中文全流程输出,可以反复优化迭代 “ 也是想尝试一下,做一个可以验证 Fable 5 长任务能力 最终做出了一个能够简单跑的框架(我没有投入任何信息源,没有喂数据 所以跑起来效果没有那么屌,不过我觉得后期再投喂一些案例,我觉得确实是可以落地的) 说说我为什么用Fable 5 来测? 因为这个任务本质不是写代码 更像是说去测试AI的长链路规划能力测试 它需要: 1/ 语义理解 2/ 叙事能力 3/ 结构能力 4/ 一致性 5/ 自我检查 这刚好是 Claude Fable 5 主打的能力 整体跑下来我觉得还算是可以的,毕竟我这种不会写代码不会设计的小屌丝,确实在Fable 5 上面使用得其乐融融的 哈哈 再说说我的TOKEN使用量吧:112.31K(按照官方的收费标准大概是在:$4.2) 要是加上文本案例 再接入一个AI对话的API框架 我觉得应该费用还要再多出个大几十吧(个人猜测,毕竟投喂数据可能会比较烧tokens) 总的来说的话我个人还是觉得这笔消费还算挺值得的,因为这本身在传统行业的话 可能会是比较高的费用,AI真的弄挺好的 说完Claude Fable 5的体验, 那我不得不说我是在哪里体验的Claude Fable 5了 我这次没有走官方通道,而是走的是我之前给大家分享的中转站 Zenmux ZenMux 因为他这几天又搞活动了,只要你账号的余额>$0 你就可以免费体验Claude Fable 5 并且 Zenmux支持(不限于): 200+ 模型统一入口 无 RPM 限制 PK 模式 可以直接做横评 如果大家也想低成本体验一下 Claude Fable 5 我觉得当前使用Zenmux是最好的选择

车九

48,436 views • 1 month ago

花了三天时间,build了我们第一个X402的产品 「X Spaces Transcription Agent」 你现在可以访问 使用它。 对我们来说,x402 不是一个“又一个支付方案”,而有可能成为未来互联网里最简单、最通用的支付协议。 但当我开始深入研究时,我发现一个很现实的问题: 今天的 x402scan 上,大部分服务其实并没有真实价值。很多调用量只是刷出来的——因为 facilitator 会代付 gas,所以你完全可以靠刷量堆数字。 (如果你感兴趣,我之后可以详细讲讲现在的刷量模式和一些典型行为。) 既然协议本身已经这么干净,那么真正缺的不是“更多 endpoint”,而是——有没有人愿意真正付费使用的 x402 服务? 所以我们换了一个思路: 别再追调用量了,从我们自己的真实需求出发,去做一个我们自己会持续付费使用的 x402 agent。 于是,我们构建了一个有明确使用价值的 x402 Server: 👉 只需用 x402 支付 1 USDC 你就可以转录任意一场 Twitter Space。 完整音频 → Whisper → LLM 多段格式化 转录完成后,这个 Space 的全文对所有人永久开放 所有人可以继续用 0.1 USDC/次 的方式使用 Chat agent 做 summary、key points、projects、translate 等二次分析 我们已经用它转录了不少 daydreams 和 x402 meta 相关的空间,如果你感兴趣可以点进去看。 为什么先做这个? 因为如果 x402 真要成为“互联网的通用支付层”,那就必须要出现一批真正愿意付费的服务: 不是刷量,不是 demo,而是你愿意掏 1 USDC、可以给你带来价值的数据资产。 而 Twitter Space 转录对我们来说就是一个非常明确的需求: 太多高质量讨论沉在音频里,不可搜索、不可引用、不可分析。 但当转录成为一个“用 1 USDC 买下的公共数据资产”之后,整个生态的 Agent 都可以在这上面做二次增值。 这个 Space Agent 只是我们构建的一批 x402 实用服务的第一个。 最后不要在熊市躺平,而是在熊市面向未来build, 而这个未来就是 X402 + ERC8004. 如果你对 x402、Web3、AI 的结合感兴趣,也可以完整的看看我们的技术文章:

0xhhh

14,695 views • 8 months ago

把网站录下来给AI看, AI能照着做出来吗? 刚刚看到了个炫酷的灯具网站, 它有个功能是点击按钮直接能看到灯点亮的效果, 甚至网站的配色也会暗淡下来, 特别有氛围. 我突然想到, 这样的网站, 如果要让AI来做, 该怎么办? 把源代码拷给它? 用一个巨复杂的 prompt 来完成? 有没有可能, 我录个视频, 展示一下这个"关灯"的效果, 然后让AI来按照视频来写网站? 于是, 这个重任就交给了今天测试的模型, 百度刚出的文心-5.0-preview, 全模态大模型, 这个模型同时支持文本, 图片, 音频, 视频作为输入, 然后可以生成文本和图片, 所以我们这个测试可以最大化的利用它的能力. 我先录制了网站的效果, 然后写了prompt作为补充, 告诉它这个效果是怎样的, 以及准备的图片材料在哪里. 值得一提的是, 网站所展示的图片也是我用文心-5.0-preview生成的. 大家可以看视频中我生成的效果. 直接说测试结论: 目前每个模态都是可用的, 而且模态之间关联性非常好, 我测试了视频+文本, 图片+文本, 图片+语音, 都可以完成任务. 当然测试也发现了一些问题, 比如 token 输出速度不是特别快, 以及偶尔会有超时问题(已反馈给百度的同学). 我的使用建议是, 多利用它的多模态能力, 来完成之前不敢想象的任务, 它真的提升了使用场景的天花板. #文心大模型 #文心5 #百度 #文心一言 #ai教程

karminski-牙医

29,929 views • 8 months ago

06大学生(大专生)第一个企业项目 本项目使用的是codex+Claude+hermes修改的过程中几乎是用codex和hermes。项目最开始的时候是先把公司那边的需求传给Claude code进行需求分享和框架搭建,然后中期是使用的codex进行ui设计,执行任务和计划,包括一些功能的测试和验证,最好完成阶段是使用的hermes进行全部功能测试,然后后面还进行了十几次修改调整也是使用的hermes进行修改验证,改一个功能就验证一下,然后再部署到云端服务器上面,循环。 因为有的地方有项目方的名字还有域名那些就没有展示,帮一个企业做的,大概就是做成了现在这样,上上周就是上一次跟公司的老板在学校里面当面谈了一会,当时说是很满意,说了一些地方需要修改和调整,你们觉得有没有什么问题啊,我现在是在自己的阿里云服务器上面跑的,后面的话再迁移部署到他们公司的服务器,但是现在还没有谈交付和收费怎么弄?比如是一次买定还是租用,还有后期的维护和后续修改的费用,部署需要收费吗?不知道怎么定价,那个公司的老板是我一个老师的朋友🤔🤔🤔 图二是新的老板,额,一个GitHub大佬推荐的,挺漂亮 说是要做一个支付宝的小程序,但是现在还没有说具体的需求🤔🤔🤔应该这几天会说。做之前一定要先谈清楚怎么分阶段交付?怎么算完成?然后根据难度和花费的时间去计费,这是这次项目的目标,也是对自己的一种锻炼吧🫡🫡🫡加油

阿金

27,335 views • 1 month ago

Claude Opus 4.8 出了之后,我的第一反应是:想试。 第二反应是:算了,token 这东西真的不经烧。 结果看到 ZenMux 现在可以体验 Opus 4.8,就拿它试了一个我最近一直想做的小东西。 我自己有个很真实的问题: 脑子里经常冒出各种产品想法。 但每次真要开始做,就会卡住。 用户是谁? 第一版到底做什么? 哪些功能应该先砍掉? 怎么定价? 第一周从哪一步开始? 上线后怎么找第一批用户? 想法很多,执行很散。 所以我让 Claude Opus 4.8 做了一个「一人公司作战室」。 需求我写得也挺直接: 输入一句产品 idea。 自动拆出产品定位、MVP、开发任务、定价方案。 再生成落地页文案、冷启动实验、风险清单和本周计划。 最好不是一个静态页面,而是真的能点、能改、能导出。 然后我就把这段话丢给 Claude Opus 4.8。 出来的效果比我预期好不少。 它真的把“一人公司怎么从想法走到执行”这件事拆开了。 左边输入产品想法。 中间生成产品蓝图、MVP 范围、定价和官网文案。 右边是任务看板和本周计划。 底部还有冷启动实验、风险雷达和 Markdown 导出。 最让我觉得有意思的是,它不是一味堆功能。 比如我输入“给小红书博主做 AI 选题助手”,它会主动判断: 第一版必须做什么。 哪些功能看起来高级,但现在应该先别碰。 怎么找第一批真实用户。 哪些风险可能让这个项目做不下去。 这点就很能体现 Opus 4.8 的能力。 普通模型经常是:你要什么,我全给你加上。 最后页面很热闹,但产品判断是空的。 Opus 4.8 更像是在帮你收敛:先想清楚用户、场景和第一步,再把它变成可以执行的工作台。 我是在 ZenMux 上试的。 它比较方便的一点是,一个 Key 就能切不同模型,新模型上线也很快。 Opus 4.8 拿来做这种带产品判断、交互状态和复杂信息结构的网页,确实挺顺。 想试 Claude Opus 4.8 的,可以从这里进:

Joruno

15,983 views • 2 months ago

刚刚过去的一天整个ai行业又有大事发生! Claude code重磅更新!今天凌晨推出了自动修复功能,现在claude code可以自己完成代码修复,自动持续提交pr以及修改bug等功能,确保代码的审核修改和上交都在自动化的过程中可以完成,这也是自周初推出自动研究功能后,本周推出的第二个自动化功能。 AI自动化写代码改代码提交代码,本周也是上升到了一个新的维度。 同时谷歌也是在今天凌晨发布了gemini3.1 flash live版本,这是一个语音输入的大模型,现在用户可以通过语音输入的方式,指导用户写代码。我觉得这种语音输入的大模型后续可以方便残疾人使用ai,这也是ai技术进步对于人类温情的体现。 谷歌也发布了一个音乐生成模型 lyria,这是一个可以帮助用户更方便的制作音乐的模型,也可以通过图片文字和视频更好的生产新的音乐,目前在谷歌ai studio已经可以使用。 Openai宣布其广告收入的年化收入也已经超过了1亿美金,他们从今年1月开始为部分美国用户提供了广告,并且和600多家公司签订了合同。如果这条路径能走通,也将为openai获得一个新的收入渠道,不过之前anthropic也已经多次嘲讽过openai的广告太多,希望不要成为下一个百度。 更多具体内容请看视频!感谢大家点赞关注支持!谢谢!

Vic TALK

14,539 views • 4 months ago