正在加载视频...

视频加载失败

今天本地部署了一个Qwen 3.8 27b 量化版本 大家觉得这个速度怎么样?能不能用?😂

63,796 次观看 • 6 天前 •via X (Twitter)

87 条评论

glaz 的头像
glaz5 天前

怎么我的qwen和你的不一样

王小波 的头像
王小波5 天前

你的是无审查版本,q8 精度,我这个q2比你这个差多了哈哈😁

小百合 的头像
小百合6 天前

不是,建议至少50token/s,本地模型本来就是思考长度换质量

王小波 的头像
王小波6 天前

没办法了,这是Qwen 3.8 系列我电脑能带动的最有性价比的了😂 但是还是干不了活哈哈

Leo 的游戏日记 的头像
Leo 的游戏日记6 天前

玩玩可以,这速度不能当生产力

王小波 的头像
王小波6 天前

回答问题都慢的把人急的😂

Leo 的游戏日记 的头像
Leo 的游戏日记5 天前

弄个满血版吧,27b 还是不错的

AGI in our lifetime 的头像
AGI in our lifetime6 天前

Here’s a trick, use say opencode-cli terminal and ask it to find optimisations for the model - ask it to benchmark the trials & tests as vLLM & the like have a LOT of insane tweaks - then see what it can do. Working isn’t running well, that’s not the same thing at all

王小波 的头像
王小波5 天前

谢谢🙏,我用这个试一试,目前只是能带动的程度😂

AGI in our lifetime 的头像
AGI in our lifetime5 天前

YouTube channel, Codacus, makes these models purr on a AA & some trail & error. I watched, said, nuhaa, & used ai 🤖

. 的头像
.6 天前

小模型+量化,精度度很拉跨,其次看你的 tok/s 也有点慢,不如接线上的 API。如果真的有本地安全需要,是小公司或者工作室,目前看下来最靠谱的就是 4x dgx spark 部署 ds v4.1f。。可以满血跑,并发也有几个,速度很 ok。。就是预算比较高。

王小波 的头像
王小波6 天前

是的,精度损失了不少,干不了活,token 太慢了,日常用不了, 但是就我自己用,我想在能不能本地破一下甲哈哈😆

Harsh 的头像
Harsh5 天前

I'd definitely use it if it were uncensored + free even at that speed 😏

王小波 的头像
王小波5 天前

哈哈,只想用无审查版本😁

Jelvin 的头像
Jelvin6 天前

看着就 10tok/s 不到吧,我开发用 50tok/s 感觉都非常折磨🥲

王小波 的头像
王小波6 天前

非常折磨,只能问一些简单的问题 ,干活是干不了的,他把内存都占了,其他软件都打不开😂

买家张俊 的头像
买家张俊6 天前

牛!

王小波 的头像
王小波6 天前

哈哈哈😂

0xMomo 的头像
0xMomo5 天前

这个速度的话,玩暗金它还是有点吃力的,但是做一些pi简单的任务是可以的

王小波 的头像
王小波5 天前

Agent 玩不了😂,电脑没空间了,刚才我联网问他科比几个fmvp 都给我乱编,失望极了🥲

Xing (シン)|個人開発 的头像
Xing (シン)|個人開発6 天前

能不能用主要取决于你要干啥🤔

王小波 的头像
王小波5 天前

聊天,慢的都把人急死了哈哈😆

Hakutaku hiroshi 的头像
Hakutaku hiroshi6 天前

智障水平

王小波 的头像
王小波6 天前

😂

逸清先生 的头像
逸清先生6 天前

拉…

王小波 的头像
王小波6 天前

事实哈哈

aidec 的头像
aidec5 天前

自己覺得起碼要35 token/s 才算可用

王小波 的头像
王小波5 天前

是啊,而且还要腾出空间给其他app用

XicE 的头像
XicE6 天前

这速度用不了一点……

王小波 的头像
王小波6 天前

是的🫣

Gilfoyle 的头像
Gilfoyle6 天前

把默认的xhigh改成medium

王小波 的头像
王小波6 天前

我试试,看有这个按钮不,我没注意直接拿出来测试了🥲

pero pero 的头像
pero pero6 天前

相当慢了,几乎没法生产。。

王小波 的头像
王小波6 天前

是啊,而且这个把内存占满了了,根本就打不开别的软件😂

YZ 的头像
YZ6 天前

只能say hi,除非你非常“有耐心”

王小波 的头像
王小波6 天前

没到这个程度😂,我试过了,可以很慢的回答一些简单的问题,上下文还不能长😭

Float Ni 的头像
Float Ni6 天前

太慢了

王小波 的头像
王小波6 天前

是啊,试了1个小时,只能回答简单的问题,超级慢。 反正肯定是干不了活。

Peiyi Hou 的头像
Peiyi Hou6 天前

不能用,不管是速度还是量化级别

王小波 的头像
王小波6 天前

确实,我晚上把这个模型试试从外接硬盘挪到我电脑里看会不会快一点,主要看能破甲不😊

Peiyi Hou 的头像
Peiyi Hou6 天前

如果是12G只能跑Iq2s试试这个 如果有16G试试这个的Iq3s破甲版

王小波 的头像
王小波6 天前

是16g 我本来就想跑步破甲版本的,AI说我的最有性价比的是我目前这个,让我装这个🥹 我晚上下载一下破甲那个,看能不能用😊,谢谢哥们

Peiyi Hou 的头像
Peiyi Hou6 天前

那就第二个链接里的这两个里面选一个了,kv量化开q8能跑64~128k上下文,关掉mtp还能再多挤出一点,不是用来写代码需要大上下文的话,就用IQ3_S,这个基本达到官方Q4KM量化的精度够用 Huihui-Qwen3.8-27B-abliterated-GSQ-RCO-IQ3_S-mtp.gguf Huihui-Qwen3.8-27B-abliterated-GSQ-RCO-IQ3_XXS-mtp.gguf

王小波 的头像
王小波6 天前

可以可以,非常感谢,哥,我这个内存不够也写不了代码,能破甲凑合用就行😁

K屿 的头像
K屿5 天前

不错不错

王小波 的头像
王小波5 天前

嘿嘿😁

KelvinKMS.com 的头像
KelvinKMS.com6 天前

不要拿 Air 來跑 AI 會容易燒壞,還有沒有 32GB 記憶體就不要玩本地模型了,還有蘋果電腦跑 AI 模型沒有 nVidia 獨立顯卡快

王小波 的头像
王小波6 天前

我问Ai给我说烧不坏😂,我用的时候都是风扇对着吹的,好像看cpu和gpu温度有点作用,准备下一个破甲的🥹,用量也不大

KelvinKMS.com 的头像
KelvinKMS.com6 天前

對,除非你特別用風扇吹,但是要隨時監控溫度,不能超過 80度,如果非剛需,我建議還是用免費瀏覽器的 AI 就好,免費速度也快,通常自己搭建 AI 模型是用在生成圖片,影片用比較多,用 AI 來寫文章不需要用到本地模型,只有極機密的資料處理才有必要

王小波 的头像
王小波6 天前

我用的还是比较多的,光这个月就开了Gtp cursor Gemini会员,还有open code go的订阅,图片生成部署说了,但是烫倒是还行,生成的不多,都用Gtp 和Gemini就代替了,本地版的llm能破甲就行,要求不高

Crio Songo 的头像
Crio Songo6 天前

我用消费卡跑27b量化差不多也是这个速度,日常个人调用完全够用,不用折腾云端了。

王小波 的头像
王小波5 天前

我感觉有点慢,等的人好着急😂

Mark Han 的头像
Mark Han6 天前

来点英伟达吧 加速一下

王小波 的头像
王小波6 天前

我也想,但是苹果笔记本不给外接显卡😭

wqwqe wqw 的头像
wqwqe wqw5 天前

使用的什么配置的电脑

王小波 的头像
王小波5 天前

Mac m4 air 16 g

wqwqe wqw 的头像
wqwqe wqw5 天前

谢谢佬,框架是用的开源的嘛? 可否分享一下

王小波 的头像
王小波5 天前

是的,在o llama里面跑的 ,模型是,Qwen3.8-27B-UD-IQ2_S.gguf,在Hugging Face 的 Unsloth 仓库下载的,仓库链接 嫌麻烦的话, 你直接给codex或者任何一个Ai,他会帮你从你下载

雪瑜 的头像
雪瑜6 天前

有点慢,感觉只有10 tok/s 还是2-bit量化,损失精度了🤣

王小波 的头像
王小波6 天前

太慢了,但是这个是我电脑带动的最大极限了,精度损失了不少,但还是有有点能力的

王希 的头像
王希6 天前

太慢了。看看你的配置?

王小波 的头像
王小波6 天前

Mac m4 air 16 g统一内存

王希 的头像
王希5 天前

正常,内存太低了,就会调用SSD,就慢下来了。

hixonchan 的头像
hixonchan5 天前

这是上个月的菜了吧为什么给我推送

王小波 的头像
王小波5 天前

我今天才部署哈哈😁

HuXiaomi 的头像
HuXiaomi6 天前

挺好的

王小波 的头像
王小波6 天前

哈哈,我感觉基本用不了的程度

北方的狼 的头像
北方的狼6 天前

啥硬件配置?

王小波 的头像
王小波6 天前

Mac m4 air 16 g统一内存,跑这个确实没法用感觉

号角 的头像
号角6 天前

聊天可以 agent 不行

王小波 的头像
王小波6 天前

我试了一会儿,聊天也不是很行. 等到我着急死了😭

Xin 的头像
Xin6 天前

明显不能用

王小波 的头像
王小波6 天前

😂 经过我的不懈努力,我发现他还是干不了活😭

nitaimei ji 的头像
nitaimei ji6 天前

显存不够,一部分模型权重跑到共享显存那里去了,所以很慢。

王小波 的头像
王小波6 天前

总共16g,看他占了14g,我以为他的gpu速度就这么慢😂,而且这个是在我外接的硬盘里面跑的,我晚上试试移动到电脑里能不能快一点?

卿嵐 的头像
卿嵐5 天前

一直在讨论。但是: 多并发,承受多少并发,没人说?怎么是最佳实践没人说? 怎么优化性能没人说。怎么能够去做最好的缓存设计没人说。 多人使用如何做前缀共享缓存没人说,解决不了这些,真的是在自娱自乐嘛?

王小波 的头像
王小波5 天前

这么专业,姐

卿嵐 的头像
卿嵐5 天前

达不到生产力不会焦虑吗?我都快疯了,因为这些破逼事

王小波 的头像
王小波5 天前

本地我都是来破甲的,干活还得云端模型🥹

古早味 的头像
古早味6 天前

16g跑27b能這樣已經很不錯了

王小波 的头像
王小波6 天前

能带动我就已经很意外了😂

高运通 的头像
高运通6 天前

啥配置 这速度稍微有点慢

王小波 的头像
王小波6 天前

Mac m4 air 16 g 10核, 确实,带这个基本上干不了活,回答问题都很吃力

chsg 的头像
chsg6 天前

@Stargridcompass 换9-14B的agent模型开个128k上下文,接个Hermes,复杂任务还是接API

王小波 的头像
王小波6 天前

@Stargridcompass 不行,我这个是统一16g内存,最大只能跑9b的,跑我目前那个,这么慢的情况下还是用不了其他软件,感觉根本没法用的程度 我试过qwen3.5 9b 连着网,连乔丹几个FMVP都能反复说错,那种没法用

chsg 的头像
chsg6 天前

@Stargridcompass 那只能接着缩,试试LFM2.5 2.6B,专门给agent用的

王小波 的头像
王小波6 天前

@Stargridcompass 2.6太小了,我用9b模型感觉都没法用,他联网搜索乔丹几个nba fmvp都答不明白, 本地模型要求不高,能破甲就行哈哈😄

相关视频