新闻与洞见

解读Attention Residuals:跨层信息选择机制与专利分析要点

介绍Attention Residuals及Block AttnRes的工作原理、实验结果的适用边界,以及撰写人工智能专利申请时需要梳理的技术特征。

原文韩语封面:示意不同处理阶段的信息组合
原文韩语封面:示意不同处理阶段的信息组合

Attention Residuals着眼于AI模型各层之间的信息传递方式。它不再以相同权重累加先前输出,而是依据学习得到的比较标准,针对当前输入决定各个表示的权重。本文先用直观例子说明其原理,再从专利实务角度梳理值得关注的具体实现。

分析对象:Kimi Team的Attention Residuals,以2026年3月16日公开的arXiv v1为准。

为什么要改进残差连接?

模型通过多个层逐步处理输入。层可以理解为一个处理阶段;残差连接则将新的处理结果加到此前传递的信息上,再送往下一阶段。

传统残差累加对先前各层输出使用相同系数。论文关注的是:随着模型加深,单个层的贡献可能被逐渐稀释。Attention Residuals比较先前的表示,并按随输入变化的权重加以组合。

注意力机制通过比较信息来确定权重。这里比较的是同一个词元在不同层形成的表示。词元是文本处理的基本切分单位,本方法所讨论的选择发生在层与层之间。

用报告批注来理解

假设三位同事分别在报告上留下批注。编辑当前句子时,撰稿人可以更多参考对该句最有帮助的那条批注。模型也是将先前处理结果按适合当前输入的比例组合起来。

例如,将批注A按10%、B按20%、C按70%的比例组合后用于后续处理。这些比例仅为便于理解而设定,并非论文中的实验数据。

实际模型使用数值表示处理结果,并依照学习得到的比较标准计算权重,而不是由人手动指定各条信息的重要性。

三个步骤理解工作机制

第一,收集先前输出,并对用于计算权重的表示进行归一化,使参与比较的数值尺度具有一致性。

第二,利用各层学习得到的比较标准计算得分,再通过softmax转换为总和为100%的权重。第三,按这些权重组合原始表示,形成下一处理阶段的输入,而非直接将归一化后的比较值作为输出。

单独保留所有先前输出会增加内存与通信开销。论文因此提出Block AttnRes:将多个层组成一个块,块内累加输出,块间再用注意力机制确定各块级表示的权重,从而降低逐层保存和传输的负担。

实验结果及适用边界

作者在训练基于Kimi Linear的模型后,报告了通识、数学、代码等评测中的改进。这些结果对应论文所述的架构、训练方式与评测条件,不能据此认定仅替换现有模型的连接方式即可获得相同效果。

以企业报告摘要系统为潜在应用场景,实施评估除摘要质量外,还应测量保存先前输出所需的内存、设备间通信量及处理时间。这仅是应用可能性的示例,并不表示已确认某款商业产品采用了该技术。

从技术方案到专利撰写的审视要点

以下属于针对公开论文所作的独立专利实务分析,不涉及特定已授权专利保护范围的解释,也不构成对可专利性的确定判断。权利要求界定所请求的保护范围,因此需要把“选择信息”这一目标落实到实现该目标的具体处理结构与步骤。

选择对象:明确所选的是单层输出,还是由多个层构成的块级表示。权重计算:梳理学习得到的比较标准、归一化及加权运算之间的组合关系和执行顺序。

存储与传输:明确保存先前结果、减少重复传输的结构及处理顺序。技术效果:结合对比条件,整理结构调整对性能、内存和通信量产生的影响。

准备AI专利分析时,建议整理处理流程图、与已有方案不同的技术特征、对比实验资料及技术公开计划。IPLEX结合已公开的AI专利分析、IP-R&D项目经验和相关著作,从权利布局角度审视技术差异。具体经历可参阅金容德代表专利代理师的官方简介。

分析基准日:2026年10月3日,依据arXiv v1。本文未独立复现实验。

查看韩文原文

本文基于发表时的情况撰写。如需就具体事项咨询,请联系IPLEX。
咨询相关业务 ↗全部文章

与IPLEX探讨技术保护与知识产权布局的下一步。