信源:X:洪明 (@hongming731) · 👁️ 35849 次研读

DeepSeek V4.1 Flash 发布:KV Cache 缩小 437 倍

💡 灵机 AI 深度洞见与核心提炼
DeepSeek 发布 552B 参数的 MoE 模型 V4.1 Flash,采用输入输出不对称的 Causal Encoder Decoder 结构,输入侧激活 8B、输出侧 16B,原生支持多模态视觉理解。
信源媒体:X:洪明 (@hongming731)
访问出处网页 ↗
阅读原文出处 ↗