Reddit热议!大神自制补丁让DeepSeek V4 Flash在RTX 5090上跑满1M上下文
2026-07-03 16:53:25
151次阅读
3个评论
Reddit网友da_dragon321发现DeepSeek V4 Flash因DSA Lightning索引器缺乏CUDA支持,在长上下文时显存需求高达256GB。他自行编写CUDA内核并集成补丁,成功在RTX 5090上实现1M上下文运行,峰值显存仅31GB,解码速度稳定在14t/s。网友实测多GPU配置同样有效,但需注意量化模型和内存配置。
0
0
2026-07-03 16:53:58

回复 |
引用
2026-07-03 16:54:26

回复 |
引用
2026-07-03 16:54:55

回复 |
引用
共3条
1
相关帖子
- Reddit热议!老外如何评价DeepSeek V4 Flash本地跑满1M上下文?
- Reddit热帖!开发者成功将DeepSeek V4量化KV缓存修复合并,单卡RTX PRO 6000跑百万上下文
- Reddit热议!Qwen3.7开放权重版首曝,1M上下文窗口引期待
- Reddit热议!DeepSeek V4 Flash本地运行表现惊艳
- Reddit热议!DeepSeek V4 Flash更新,性能碾压GLM 5.2
- Reddit热议!llama.cpp火速支持DeepSeek V4 Flash加速推理
- Reddit热议!DeepSeek V4在AMD芯片上跑出32 tok/s,性能翻倍引围观
- DeepSeek V4 Pro/Flash上线HuggingFace,网友热议参数与运行门槛
- Reddit热议!DeepSeek V4 Flash开源模型性能炸裂,直逼顶级闭源?
- Reddit热议!DeepSeek v4 Flash权重发布,老外直呼OpenAI降价被逼?