正在加载视频...
视频加载失败
introducing simple-llm: a ~950 line, powerful & extensible inference engine that performs on par with vllm. enjoy :) performance (gpt-oss-120b, on an h100): - batch=1: 135 tok/s (vllm: 138) - batch=64: 4,041 tok/s (vllm: 3,846)
59,730 次观看 • 5 个月前 •via X (Twitter)
0 条评论
暂无评论
原始帖子的评论将显示在这里
