模型 信源:HuggingFace Daily Papers(社区热门论文) · 👁️ 16135 次研读

DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩

DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩
💡 灵机 AI 深度洞见与核心提炼
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。
信源媒体:HuggingFace Daily Papers(社区热门论文)
访问出处网页 ↗
阅读原文出处 ↗