单卡RTX3090跑Qwen3.6 27B 10万上下文达50t/s
2026-05-08 01:38:17
94次阅读
3个评论
楼主分享使用指定MTP量化版Qwen3.6-27B GGUF模型、llama.cpp对应PR及优化配置,在RTX3090上实现10万上下文下50t/s的推理速度;社区网友讨论了MTP参数影响、多类设备适配、缓存量化的权衡等问题。
0
0
2026-05-08 01:38:50

回复 |
引用
2026-05-08 01:39:19

回复 |
引用
2026-05-08 01:39:48

回复 |
引用
共3条
1