Laughing🪁's banner
Laughing🪁's profile picture

Laughing🪁

@0xLaughing • 16,818 subscribers

👨🏻‍🍳 apac lead aka chief reply guy @GoKiteAI @MarathonBuild @KiteAIChinese @Kite_Frens_Eco @KiteAIFDN | prev: solution architect @AlibabaGroup

Shorts

好多人吐槽 Astra 上线以后额度用得很快,这次我可能站 Astra,不要再无脑选 xhigh 甚至 ultra 了 大多数人选档位,是把自己「觉得有多难」投影给模型,是一种主观的「感受」,而不是按任务的客观复杂度来配算力。 思维惯性会让人默认:更高档 = 更认真、更聪明 真正该看的是 ROI,且模型自己也会在简单题上 overthink,用户再叠一层复杂解释,token 浪费就显得更明显。 另外从厂商侧也说的通,如果没有档位、人人默认拉满,GPU 集群会被简单问答占满(尤其是长思维链占用的 KV cache),延迟变差,用户额度也很快耗尽。 让用户自己选档位,等于把「这笔请求值不值得多烧算力」的问题还给用户,同时保护供给。 对 vibe coding 来说,选档位是人类为数不多还需要亲自想一想的事了,不过我挺好奇为什么 coding 模型迟迟不出自动路由?是怕分流错了要背锅吗?

好多人吐槽 Astra 上线以后额度用得很快,这次我可能站 Astra,不要再无脑选 xhigh 甚至 ultra 了 大多数人选档位,是把自己「觉得有多难」投影给模型,是一种主观的「感受」,而不是按任务的客观复杂度来配算力。 思维惯性会让人默认:更高档 = 更认真、更聪明 真正该看的是 ROI,且模型自己也会在简单题上 overthink,用户再叠一层复杂解释,token 浪费就显得更明显。 另外从厂商侧也说的通,如果没有档位、人人默认拉满,GPU 集群会被简单问答占满(尤其是长思维链占用的 KV cache),延迟变差,用户额度也很快耗尽。 让用户自己选档位,等于把「这笔请求值不值得多烧算力」的问题还给用户,同时保护供给。 对 vibe coding 来说,选档位是人类为数不多还需要亲自想一想的事了,不过我挺好奇为什么 coding 模型迟迟不出自动路由?是怕分流错了要背锅吗?

36,583 просмотров

最近一个月真有点 #Gemini 成瘾了 等飞机有点无聊 10分钟做了一个手势控制的圣诞树应用出来

最近一个月真有点 #Gemini 成瘾了 等飞机有点无聊 10分钟做了一个手势控制的圣诞树应用出来

147,754 просмотров

ETH杭州很精彩了 还得是年轻人🥹 (随处可见gmgn打狗 Haze 𝓰𝓶𝓰𝓷𝓪𝓲 )

ETH杭州很精彩了 还得是年轻人🥹 (随处可见gmgn打狗 Haze 𝓰𝓶𝓰𝓷𝓪𝓲 )

84,934 просмотров

Videos

Больше нет контента для загрузки