论文 信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 19609 次研读

混合潜在注意力让循环模型吞吐提升7.4倍

💡 灵机 AI 深度洞见与核心提炼
Virginia Tech 论文提出 Hybrid Latent Attention,将较旧的 token 缓存为紧凑向量供注意力直接读取,使循环 LLM 在单 GPU 上可容纳的请求量提升 4.0 至 8.8 倍,且精度损失很小。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗