Reddit热议!llama.cpp火速支持DeepSeek V4 Flash加速推理
2026-08-03 01:09:56
31次阅读
2个评论
llama.cpp刚合并了DeepSeek V4 Flash的MTP/DSpark支持,网友实测生成速度大幅提升。有用户用DSpark草稿模型将速度从20t/s拉到28-30t/s,还有人在8块RTX 3090上从35涨到50t/s,但需注意当前GGUF文件多数未包含草稿模块,需手动下载。
0
0
2026-08-03 01:10:29

回复 |
引用
2026-08-03 01:10:58

回复 |
引用
共2条
1
相关帖子
- Reddit热议!llama.cpp正式支持DFlash,AI推理速度再提升
- llama.cpp MTP支持进入beta 本地大模型推理大幅提速
- Reddit热议!DeepSeek V4 Flash本地运行表现惊艳
- Reddit热议!DeepSeek V4 Flash更新,性能碾压GLM 5.2
- DeepSeek V4 Pro/Flash上线HuggingFace,网友热议参数与运行门槛
- Reddit热议!DeepSeek V4 Flash开源模型性能炸裂,直逼顶级闭源?
- Reddit热议!DeepSeek v4 Flash权重发布,老外直呼OpenAI降价被逼?
- Reddit热议!本地大模型实测:DeepSeek V4 Flash速度碾压Sonnet,质量相当
- LLaMA.cpp实现MTP功能,Gemma4令牌生成提速40%
- Reddit热议!DeepSeek V4 Flash性价比炸裂,老外直呼“智能便宜到不用计量”