正在加载视频...

视频加载失败

Hermes Agent 刚发布 Mixture of Agents 2.0,把多个前沿模型混合成一个虚拟模型使用 原理很直接:GPT-5.5、DeepSeek V4、Sonnet 4.6 作为参考模型同时处理同一个问题,Opus 4.8 作为聚合器综合最终答案 跑分结果比单独用 Opus 4.8 高 8%,比 GPT-5.5 高 11% 最关键的是在 Hermes 里就像普通模型一样调用,/model 命令切换就行,不需要自己搭框架 单个模型都有盲区,混着用反而能互补,开源社区找到了一条弯道超车路线 你觉得 MoA 这种「模型组合拳」会成为主流用法吗?

16,616 次观看 • 3 个月前 •via X (Twitter)

6 条评论

libapi 的头像
libapi3 个月前

我觉得讨论太久了,昨天玩了一会 ,MOa 比较合适分析类的研究, 平常就算了。

Adel Bucetta 的头像
Adel Bucetta3 个月前

the honest answer is that most teams struggle to integrate multiple models effectively, but the idea of a single virtual model that can leverage them all is tantalizingly close to being solved

Trev吳 的头像
Trev吳3 个月前

混著用更便宜吧?準備測試下。只用CC挺貴的

JIMMY仔 的头像
JIMMY仔3 个月前

性价比很高的方式,就看框架和具体路由调用水平和机制了

安叫兽|Bird🕊️ 🔶 BNB 的头像
安叫兽|Bird🕊️ 🔶 BNB3 个月前

这下聚合器压力也挺大的

Bob 的 AI 工作间 的头像
Bob 的 AI 工作间3 个月前

感觉 Hermes 比龙虾更专注,好用得多

相关视频

Hermes Agent这样设置那么恭喜你为了省钱又进一步😂 deepseek为主大模型,kimi2.6为视觉模型,并且无需来回切换,只要丢图片进去就会自动使用kimi2.6去识别。(理论是你可以设置更多的大模型去完成不同的工作,并且全程自动无需切换大模型) 写很多以X文章的形式去编辑这类干货教程已经很多了,我想试试普通的发帖方式编辑会不会被更多的人去看到。 那么话不多说下面直接是干货! - 主模型:deepseek-v4-pro 视觉模型:kimi-k2.6 运作逻辑:deepseek 负责所有的工具调用、代码、排查、对话,一旦你丢过来图片或者视频帧,系统自动切到 kimi 去识图,识完把结果扔回给 deepseek 继续处理。整个过程不需要手动切换模型,你体感上就是同一个助手在干活,但实际上后面是两个大脑在协作。 - 为什么这样搭 deepseek-v4-pro 的工具调用和长上下文处理能力确实强,跑代码任务、排查问题、多步骤复杂操作的稳定性比 kimi 好一截。 但它有一个硬伤暂时不支持多模态,直接给它丢图片会报 unknown variant image_url 的错。 而 kimi-k2.6 的多模态能力不用说,中文 OCR 也准,但纯文本推理和工具调用不如 deepseek 稳。 所以最优解就是各取所长,deepseek 当大脑,kimi 当眼睛。 (其实说白了就是为了省Token!!!) - 配置步骤 第一步,确保 API Key 就位。在 `~/.hermes/.env` 里确认两行: ``` DEEPSEEK_API_KEY=你的deepseek密钥 KIMI_API_KEY=你的kimi密钥 ``` 第二步,切主模型,终端敲: ``` hermes config set model.default deepseek-v4-pro hermes config set model.provider deepseek ``` 第三步,设视觉模型: ``` hermes config set kimi-k2.6 hermes config set kimi-coding hermes config set ``` 第四步,如果你的 kimi key 是老 key(sk- 开头不是 sk-kimi- 开头),需要在 `.env` 最后加一行: ``` KIMI_BASE_URL= ``` 新 key 走 key 走 默认写的 是错的,不改会 401。 第五步,`/reset` 重开会话,生效。 - 踩过的坑 一个是上面说的 api 地址问题, 和 差一个字母,排查了好一阵。 另一个更隐蔽:Hermes 内置的 vision 工具往 kimi API 发请求时,content 数组里 image_url 排在了 text 前面,kimi 的接口不认这个顺序,偶尔 400。 目前的变通方案是发图时绕过内置工具,直接 Python 调 moonshot API,text 放 image_url 前面就没事。 不影响使用,但不算完美,等后续优化。 - 配完之后你正常跟他聊天就行,deepseek 处理一切。 发图过来的时候,你不需要说"用 kimi 看",系统自动检测到图片就走 kimi 视觉,识读完无缝回到 deepseek 继续对话。 你体感上就是同一个助手能看能想能干,但后台其实是两个模型在做各自最擅长的事。 这个方案的最大好处是不用你在聊天里手动切模型,流程全自动。而且以后如果想换视觉模型,改 ` 一行就行,不影响主模型。 - 兄弟们有哪个不懂的直接甩在评论区,狙击手会挨个解答!

DeFi狙击手 | Ai🕊️|Gate美股0费率

25,821 次观看 • 4 个月前

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 次观看 • 2 年前