Google 与 KAIST 论文提出 Declarative Attention,让模型自选读取上下文,注意力开销降低 52.0%
💡 灵机 AI 深度洞见与核心提炼
Google 与 KAIST 的论文提出 Declarative Attention(DA),模型通过 <global>、<focus>、<local> 三种模式在思维链中声明需要关注的上下文,推理引擎据此跳过大部分 KV cache 读取,无需额外的外置打分器。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗