Reddit热议!大神自制补丁让DeepSeek V4 Flash在RTX 5090上跑满1M上下文
2026-07-03 16:53:25
245次阅读
3个评论
Reddit网友da_dragon321发现DeepSeek V4 Flash因DSA Lightning索引器缺乏CUDA支持,在长上下文时显存需求高达256GB。他自行编写CUDA内核并集成补丁,成功在RTX 5090上实现1M上下文运行,峰值显存仅31GB,解码速度稳定在14t/s。网友实测多GPU配置同样有效,但需注意量化模型和内存配置。
0
0
2026-07-03 16:53:58

回复 |
引用
2026-07-03 16:54:26

回复 |
引用
2026-07-03 16:54:55

回复 |
引用
共3条
1
相关帖子
- Reddit热议!老外如何评价DeepSeek V4 Flash本地跑满1M上下文?
- Reddit热帖!开发者成功将DeepSeek V4量化KV缓存修复合并,单卡RTX PRO 6000跑百万上下文
- Reddit热议!4B小模型叫板Qwen 9B,还支持1M上下文?
- Reddit热议!Qwen3.7开放权重版首曝,1M上下文窗口引期待
- Reddit热议!DeepSeek V4 Flash跑分遭质疑:超时作弊?
- Reddit热议!DeepSeek V4 Flash本地运行表现惊艳
- Reddit热议!DeepSeek V4 Flash更新,性能碾压GLM 5.2
- Reddit热议!DeepSeek V4 Flash ARC-AGI高分遭质疑
- Reddit热议!DeepSeek V4在AMD芯片上跑出32 tok/s,性能翻倍引围观
- Reddit热议!llama.cpp火速支持DeepSeek V4 Flash加速推理