灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
10月7日 19:30
论文
信源:
X:Rohan Paul (@rohanpaul_ai)
· 👁️ 19609 次研读
混合潜在注意力让循环模型吞吐提升7.4倍
💡 灵机 AI 深度洞见与核心提炼
Virginia Tech 论文提出 Hybrid Latent Attention,将较旧的 token 缓存为紧凑向量供注意力直接读取,使循环 LLM 在单 GPU 上可容纳的请求量提升 4.0 至 8.8 倍,且精度损失很小。
信源媒体:
X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅