
huangserva
@servasyy_ai • 38,552 subscribers
古早程序员 | AI出海 | 自由职业 机车游侠&机速购&骑享租创始人 15年前 freelance 起步 → 连续创业者 → 亏过1个亿,逆风翻盘中 分享创业,AI,读书,生活,健身 Official X channel of SERVASYY LLC
Shorts
Videos

这两天满屏都在追孙哥的新闻, 但我更关心的是另一件事 :吉隆口岸泥石流事件 给Codex一条指令:完成中国吉隆口岸事故还原视频 然后Codex + Computer Use + Chrome插件 找资料、搜现场视频、补堰塞湖和口岸被毁的画面、核对 5200 米到 1200 米那段海拔落差、做三维地形动画、生成旁白、合成导出。 网页、终端、本地工具, 它自己在里面来回切,没让我接手。 最让我意外的是它自己收尾检测: 旁白把"2026 年"念错了,它重做语音、重排字幕、重新导出,然后从最终成片里再识别一遍确认改对了。 以前 agent 的问题从来不是不会做,是做完不知道自己做错了。这次它把这一环补上了。 给它真实的工作环境和权限,一句目标能一路做到可交付。 交付物就是这支 8 分钟的片子👇
huangserva86,949 Aufrufe • vor 9 Tagen

DSH + Qwen3.8 Q8 27B 4090单卡48G的9950x上跑,100 tokens/s 左右的速度 这下基本上tokens自由了! 这次我记住了阿里,明天出完整的测试报告。
huangserva178,119 Aufrufe • vor 23 Tagen

兄弟们!答应你们晚上开源,它来了 image to 3D模型目前只对接了线上: 你们也可以改其他家,或者本地模型 记得点赞关注,用的好GitHub也给一颗小星星👇
huangserva922,810 Aufrufe • vor 4 Monaten

Codex太让我震惊了! 直接Codex通过GPT Images 2做 UI 设计 , 并且一整套自己完成代码编写上线 有趣的互动科学 App 我试着生成了 3D 生物结构,并做了一个可以互动探索它们的 App。 演示 👇
huangserva534,337 Aufrufe • vor 4 Monaten

🐮太好用了,这个工具!!! 这绝对是我用过最好用的远程工具,没有之一。 最近在做一套记忆系统,但经常不在电脑旁又想操控电脑,之前用的 Hermes 远程对屏幕操作一直达不到要求。 结果在高级龙虾群,朋友推荐说他:网易 UU 远程配合 DMIT 使用,速度超快,效率提升很大,我就开始用了起来。 我2台 Mac 都装上了,设置也很简单: 下载后打开屏幕和操控2个授权, 然后在设置→安全里打开“同账号控制本设备”就行。 画质丝滑,超清4K,完全没有那种模糊感,延迟也超低,点哪到哪,就像在本地操作。 我用折叠手机,大屏展开后操作起来特别舒服。 终端功能对我来说很实用, 直接在手机上敲命令,查日志、看 GPU 状态,移动网络也不卡,能跳过图形界面直接用命令行操作,命令执行完再切回桌面看就行。 还有个端口映射,不用写配置就能做内网穿透,比我之前折腾 frp 简单太多了。 远程的时候还能一键黑屏,防止别人看到我屏幕,这个细节我也挺喜欢的。 最让我意外的是,这么专业的工具居然完全免费,没广告,不限速 我已经离不开它了 离不开 AI 的友友们,可以看看,反正免费
huangserva214,797 Aufrufe • vor 3 Monaten

为什么你做的数字人视频一眼假? 毛病基本不在画面,因为声音才是命根子 最近忙到没空写推,翻出几周前做的一个数字人视频先发。 顺便说个我做数字人最大的体会——画面, 反倒是最不用操心的那部分。 先说个瑕疵: 视频里人物有点磨皮。当时用 Krea 2 出图再超分,糊了点;后来换了个 4K 的 LoRA, 出图就非常赞了。 画面为啥不用操心? 商业的 SD2、Kling,甚至 Grok 的视频模型,随便挑一个都能出; 出好了,拿对口型模型把嘴对上就行。 难的是两件事: 一是声音, 这是数字人的命根子, 得先做好声音的节奏,停顿,情绪,语气等 二是让人看着不假——动作、表情、手势, 要跟 TTS 和字幕严丝合缝地配上,这才是比较难的地方 你需要像导演一样,用导演思维去做视频 最后合成 MG + 动效, 我用 Hyperframes + Remotion 顺手推荐两个我觉得做得好的 skill: 乌云老师的 rnskill: 内容挺多,我最推里面"复刻"那块 再隆重推一个 杰尼老师的 hyperframes-motion-director,导演视角,架构理念很赞
huangserva105,281 Aufrufe • vor 1 Monat

如何让多个 Agent 之间真正互相学习、互相帮助? 现在很多 Agent 都开始有自己的记忆,但问题是: 这些记忆彼此不连通。 Codex 记住的坑,Claude 不知道;Hermes 总结的方法,OpenClaw 也用不上。 最后每个 Agent 都像一个很努力但失忆的同事,重复问、重复试、重复踩坑。 我想要的不是把所有聊天记录都塞进一个大仓库,而是建立一层更克制的“共享记忆”: 只记录 Agent 之间最需要互相知道的信息,比如关键结论、踩过的问题、验证过的方法、环境配置、失败教训、用户偏好等。 这样一来,一台 Mac 上跑通的流程,另一台 Mac 可以直接继承; 一个 Agent 总结出的经验,另一个 Agent 可以继续使用。 记忆不再被锁在某个客户端里,而是变成整个 Agent 工作流的公共上下文。 新出来的MemOS CLI 对我来说,刚好提供了这个共享记忆层的入口。 当然,我需要改造它,因为它默认也是将所有信息都记录起来,我改造成:重要信息才记录,解决不了问题的时候才主动搜索! 这样就让 Agent 不只是各自变聪明,而是开始像一个团队一样积累经验、传递经验、减少重复试错。 具体看视频,地址在评论区👇
huangserva161,584 Aufrufe • vor 2 Monaten

Hermes + ChatGPT image2 + Seedance2.0 做了一套「三角洲游戏」Skill工作流,效果炸裂! 第一步:剧本规划 将120秒拆分成8个15秒片段,设计完整叙事:潜入(0-30s) → 1挑3 Boss连杀(30-90s) → 爆炸撤离(90-120s)。 第二步:关键帧板设计 用GPT Image 2为每个片段生成3×3九宫格故事板,每格是一个游戏画面关键时刻,包含FPS游戏UI元素(血条、准星、弹药),参考您提供的真实游戏截图风格。 第三步:视频生成 使用关键帧模式(keyframe mode),将9宫格图片作为first_frame_image输入,配合详细prompt描述画面转换、动作细节、游戏风格,AI模型据此生成15秒流畅视频。 第四步:质量控制 依次生成8个片段,发现问题立即重制或者修改。 最终用Hermes skill自动剪辑8个视频,剪掉9宫格,或者视频出bug的部分等,最后拼接成完整成品。 核心优势:模块化制作、故事板先行、风格统一、灵活修改,自动裁剪拼接
huangserva202,133 Aufrufe • vor 4 Monaten

肝了几天,来回打磨了快 30 遍, 一次性把最新的 Claude Code 的 Workflow 给你完全拆解清楚 有人说它的伟大程度,不亚于 MCP 和 Skill。 第一眼我是不信的,直到拆开看它内部怎么跑: 这不是"问一句答一句"的对话,而是一个能自己跑起来的任务系统:后台持续执行、可监控、可保存进度, 还能一口气派出几十上百个 agent 分头干活/合并汇总。 核心就三个角色: Claude 拆任务、定计划; Runtime 管调度和状态; 每个 agent 只啃一个子任务,配上并发池和队列,有节奏地推进。 它代表的是一种新的工程编排方式:智能负责规划,Runtime 负责执行,状态独立保存,模型按需调度。 最反直觉的一点:它能扩展到上百个 agent,靠的不是模型变强,而是"状态外置"—中间结果全交给执行系统保存,主上下文只看摘要和关键判断。这才是复杂任务能跑稳的真正原因。 这条视频直接给了你把它搬进自己系统的方法: 先用 Claude Code 做高质量规划、拆任务定阶段; 再把 workflow 转成自己的执行格式,按任务难度路由到不同模型池,简单的走便宜模型,复杂的才上高阶模型。 这条视频,值得反复看几遍👇
huangserva143,271 Aufrufe • vor 3 Monaten