单卡RTX3090跑Qwen3.6 27B 10万上下文达50t/s
2026-05-08 01:38:17
94次阅读
3个评论
楼主分享使用指定MTP量化版Qwen3.6-27B GGUF模型、llama.cpp对应PR及优化配置,在RTX3090上实现10万上下文下50t/s的推理速度;社区网友讨论了MTP参数影响、多类设备适配、缓存量化的权衡等问题。
收藏 0 0
    小陈 manage advert
    2026-05-08 01:38:50
    回复 |  引用
    小陈 manage advert
    2026-05-08 01:39:19
    回复 |  引用
    小陈 manage advert
    2026-05-08 01:39:48
    回复 |  引用
共3条 1

登录 后评论。没有帐号? 注册 一个。

小陈

manage advert
  • 0 回答
  • 0 粉丝
  • 0 关注