Загрузка видео...
Не удалось загрузить видео
我用一台24GB Mac,实现了“Token自由” 最近,我在一台24GB内存的M4 Mac mini上,本地部署了Qwen3.8-27B。 不是缩水版,也不是调用云端API,而是: 😎Qwen3.8-27B完整模型 ☑️MLX 4-bit量化 ☑️MTP推测解码加速 ☑️支持文字、图片和思考模式 ☑️提供OpenAI兼容接口 ☑️所有对话完全在本机完成 这套模型的主体大约15GB,MTP草稿模型约256MB,实际运行峰值内存约18.17GB。 也就是说,一台24GB的Apple Silicon Mac,确实可以把27B级别的多模态模型装进口袋里。 / 我把上下文设置为8K、并发设置为1,并启用了MTP block size 3。在这台M4 Mac mini上的实测结果是: 普通短回答约4.12 token/s MTP接受率较高时接近9.94 token/s 1:文字对话正常 2:图片识别正常 3:思考模式正常 模型启动大约需要6~8秒 它当然没有小模型那么快,也比不上云端服务器集群。 但它有一个非常重要的优势:不再按Token付费。 模型下载完成以后,即使断开网络也能继续运行。聊天记录、图片、文件和提示词都不需要离开自己的电脑。 可以用它做翻译、总结、写作、代码分析、资料整理,也可以通过OpenAI兼容接口接入自己的工作流。 浏览器只是一个聊天界面,并不是必需的。终端、桌面客户端或者自己编写的程序,都可以直接调用这个本地模型。 我给它分配了独立目录、独立Python环境和独立端口,我主要为了千问和电脑里原有的百灵模型共存。 只是24GB内存不适合同时加载两套大模型,使用时切换即可,不会影响原有模型文件。 #Token自由 #Qwen #MLX #MTP #AppleSilicon #MacMini #本地大模型 #AI部署
30,119 просмотров • 2 дней назад •via X (Twitter)
Комментарии: 0
Нет доступных комментариев
Здесь появятся комментарии из оригинального поста
