正在加载视频...
视频加载失败
今天本地部署了一个Qwen 3.8 27b 量化版本 大家觉得这个速度怎么样?能不能用?😂
63,796 次观看 • 6 天前 •via X (Twitter)
87 条评论

怎么我的qwen和你的不一样

你的是无审查版本,q8 精度,我这个q2比你这个差多了哈哈😁

不是,建议至少50token/s,本地模型本来就是思考长度换质量

没办法了,这是Qwen 3.8 系列我电脑能带动的最有性价比的了😂 但是还是干不了活哈哈

玩玩可以,这速度不能当生产力

回答问题都慢的把人急的😂

弄个满血版吧,27b 还是不错的

Here’s a trick, use say opencode-cli terminal and ask it to find optimisations for the model - ask it to benchmark the trials & tests as vLLM & the like have a LOT of insane tweaks - then see what it can do. Working isn’t running well, that’s not the same thing at all

谢谢🙏,我用这个试一试,目前只是能带动的程度😂

YouTube channel, Codacus, makes these models purr on a AA & some trail & error. I watched, said, nuhaa, & used ai 🤖

小模型+量化,精度度很拉跨,其次看你的 tok/s 也有点慢,不如接线上的 API。如果真的有本地安全需要,是小公司或者工作室,目前看下来最靠谱的就是 4x dgx spark 部署 ds v4.1f。。可以满血跑,并发也有几个,速度很 ok。。就是预算比较高。

是的,精度损失了不少,干不了活,token 太慢了,日常用不了, 但是就我自己用,我想在能不能本地破一下甲哈哈😆

I'd definitely use it if it were uncensored + free even at that speed 😏

哈哈,只想用无审查版本😁

看着就 10tok/s 不到吧,我开发用 50tok/s 感觉都非常折磨🥲

非常折磨,只能问一些简单的问题 ,干活是干不了的,他把内存都占了,其他软件都打不开😂

牛!

哈哈哈😂

这个速度的话,玩暗金它还是有点吃力的,但是做一些pi简单的任务是可以的

Agent 玩不了😂,电脑没空间了,刚才我联网问他科比几个fmvp 都给我乱编,失望极了🥲

能不能用主要取决于你要干啥🤔

聊天,慢的都把人急死了哈哈😆

智障水平

😂

拉…

事实哈哈

自己覺得起碼要35 token/s 才算可用

是啊,而且还要腾出空间给其他app用

这速度用不了一点……

是的🫣

把默认的xhigh改成medium

我试试,看有这个按钮不,我没注意直接拿出来测试了🥲

相当慢了,几乎没法生产。。

是啊,而且这个把内存占满了了,根本就打不开别的软件😂

只能say hi,除非你非常“有耐心”

没到这个程度😂,我试过了,可以很慢的回答一些简单的问题,上下文还不能长😭

太慢了

是啊,试了1个小时,只能回答简单的问题,超级慢。 反正肯定是干不了活。

不能用,不管是速度还是量化级别

确实,我晚上把这个模型试试从外接硬盘挪到我电脑里看会不会快一点,主要看能破甲不😊

如果是12G只能跑Iq2s试试这个 如果有16G试试这个的Iq3s破甲版

是16g 我本来就想跑步破甲版本的,AI说我的最有性价比的是我目前这个,让我装这个🥹 我晚上下载一下破甲那个,看能不能用😊,谢谢哥们

那就第二个链接里的这两个里面选一个了,kv量化开q8能跑64~128k上下文,关掉mtp还能再多挤出一点,不是用来写代码需要大上下文的话,就用IQ3_S,这个基本达到官方Q4KM量化的精度够用 Huihui-Qwen3.8-27B-abliterated-GSQ-RCO-IQ3_S-mtp.gguf Huihui-Qwen3.8-27B-abliterated-GSQ-RCO-IQ3_XXS-mtp.gguf

可以可以,非常感谢,哥,我这个内存不够也写不了代码,能破甲凑合用就行😁

不错不错

嘿嘿😁

不要拿 Air 來跑 AI 會容易燒壞,還有沒有 32GB 記憶體就不要玩本地模型了,還有蘋果電腦跑 AI 模型沒有 nVidia 獨立顯卡快

我问Ai给我说烧不坏😂,我用的时候都是风扇对着吹的,好像看cpu和gpu温度有点作用,准备下一个破甲的🥹,用量也不大

對,除非你特別用風扇吹,但是要隨時監控溫度,不能超過 80度,如果非剛需,我建議還是用免費瀏覽器的 AI 就好,免費速度也快,通常自己搭建 AI 模型是用在生成圖片,影片用比較多,用 AI 來寫文章不需要用到本地模型,只有極機密的資料處理才有必要

我用的还是比较多的,光这个月就开了Gtp cursor Gemini会员,还有open code go的订阅,图片生成部署说了,但是烫倒是还行,生成的不多,都用Gtp 和Gemini就代替了,本地版的llm能破甲就行,要求不高

我用消费卡跑27b量化差不多也是这个速度,日常个人调用完全够用,不用折腾云端了。

我感觉有点慢,等的人好着急😂

来点英伟达吧 加速一下

我也想,但是苹果笔记本不给外接显卡😭

使用的什么配置的电脑

Mac m4 air 16 g

谢谢佬,框架是用的开源的嘛? 可否分享一下

是的,在o llama里面跑的 ,模型是,Qwen3.8-27B-UD-IQ2_S.gguf,在Hugging Face 的 Unsloth 仓库下载的,仓库链接 嫌麻烦的话, 你直接给codex或者任何一个Ai,他会帮你从你下载

有点慢,感觉只有10 tok/s 还是2-bit量化,损失精度了🤣

太慢了,但是这个是我电脑带动的最大极限了,精度损失了不少,但还是有有点能力的

太慢了。看看你的配置?

Mac m4 air 16 g统一内存

正常,内存太低了,就会调用SSD,就慢下来了。

这是上个月的菜了吧为什么给我推送

我今天才部署哈哈😁

挺好的

哈哈,我感觉基本用不了的程度

啥硬件配置?

Mac m4 air 16 g统一内存,跑这个确实没法用感觉

聊天可以 agent 不行

我试了一会儿,聊天也不是很行. 等到我着急死了😭

明显不能用

😂 经过我的不懈努力,我发现他还是干不了活😭

显存不够,一部分模型权重跑到共享显存那里去了,所以很慢。

总共16g,看他占了14g,我以为他的gpu速度就这么慢😂,而且这个是在我外接的硬盘里面跑的,我晚上试试移动到电脑里能不能快一点?

一直在讨论。但是: 多并发,承受多少并发,没人说?怎么是最佳实践没人说? 怎么优化性能没人说。怎么能够去做最好的缓存设计没人说。 多人使用如何做前缀共享缓存没人说,解决不了这些,真的是在自娱自乐嘛?

这么专业,姐

达不到生产力不会焦虑吗?我都快疯了,因为这些破逼事

本地我都是来破甲的,干活还得云端模型🥹

16g跑27b能這樣已經很不錯了

能带动我就已经很意外了😂

啥配置 这速度稍微有点慢

Mac m4 air 16 g 10核, 确实,带这个基本上干不了活,回答问题都很吃力

@Stargridcompass 换9-14B的agent模型开个128k上下文,接个Hermes,复杂任务还是接API

@Stargridcompass 不行,我这个是统一16g内存,最大只能跑9b的,跑我目前那个,这么慢的情况下还是用不了其他软件,感觉根本没法用的程度 我试过qwen3.5 9b 连着网,连乔丹几个FMVP都能反复说错,那种没法用

@Stargridcompass 那只能接着缩,试试LFM2.5 2.6B,专门给agent用的

@Stargridcompass 2.6太小了,我用9b模型感觉都没法用,他联网搜索乔丹几个nba fmvp都答不明白, 本地模型要求不高,能破甲就行哈哈😄
