news 2026/5/25 22:33:35

论文解读:ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
论文解读:ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models

论文发表于NLP顶会EMNLP 2025(原文链接)。大模型CoT产生过短推理,即使简单数学问题也性能下降。本文研究推理长度如何嵌入推理模型的隐藏表示,以影响准确性:

1、发现,推理长度由表示空间中的线性方向决定,从而能沿着该方向引导模型,诱导过短推理。

2、引入权重编辑方法ThinkEdit,缓解过短推理:

  • 识别小部分(约4%)驱动短推理行为的注意力。

  • 编辑这些头部的输出投影权重,删除简短的推理方向。

方法

提升推理长度的Steering向量

在GSM8K和Math-Level5数据集上,将模型推理过程截断为定长,然后让大模型根据截断的推理内容生成答案。图1表明推理长度过短、过长都会损害性能。为此,作者想找对模型推理长度产生影响的特征向量。

1、用2000个GSM8K数据,根据模型推理长度在100 token以内和超过1000 token,将数据划分为$\mathcal{D}_{\text{short}},\mathcal{D}_{\text{long}}$

2、将模型分别在$\mathcal{D}_{\text{short}},\mathcal{D}_{\text{long}}$上推理得到的中间表示进行平均,得到四个MLP和Attention层输出的平均表示:

$\bar{r}^{\text{mlp}}_{\ell,\text{short}}, \bar{r}^{\text{mlp}}_{\ell,\text{long}},\bar{r}^{\text{attn}}_{\ell,\text{short}},\bar{r}^{\text{attn}}_{\ell,\text{long}}$

3、将long表示减去short表示,得到steering向量:

$v_{\ell}^{\text{mlp}} = \bar{r}^{\text{mlp}}_{\ell,\text{long}} - \bar{r}^{\text{mlp}}_{\ell,\text{short}}$

$v_{\ell}^{\text{attn}} = \bar{r}^{\text{attn}}_{\ell,\text{long}} - \bar{r}^{\text{attn}}_{\ell,\text{short}}$

4、则当推理生成每个token的时候,以一定比例加上steering向量,即可对模型的推理长度进行调整:

$r_{\ell}^{\mathrm{mlp}} \leftarrow r_{\ell}^{\mathrm{mlp}} + \alpha v_{\ell}^{\mathrm{mlp}}$

$r_{\ell}^{\mathrm{attn}} \leftarrow r_{\ell}^{\mathrm{attn}} + \alpha v_{\ell}^{\mathrm{attn}}$

5、图3展示了对所有层的表示进行调整时,$\alpha$的变化对模型性能和推理长度的影响。可以看出steering向量的确是有效改编了模型推理长度和性能。图6展示了$\alpha$设置为-1/1时,单独调整某层表示时产生的影响。

ThinkEdit: 调整注意力头输出权重

为了观察不同的注意力头对Steering向量的贡献,如式(5)所示,将每个注意力头输出(因为它直接加到注意力输出上)与归一化的负steering向量$-\hat{v}_{\ell}^{\text{attn}}$内积,得到贡献度$\bar{C}^h_{\text{short}}$。图4可视化了各模型不同注意力头对Steering向量的贡献度。

作者找到short贡献前4%大的注意力头,通过调整它们的输出矩阵来提升模型推理长度:

$W_o^{\text{h}_\ell} \leftarrow W_o^{\text{h}_\ell} \left(I - (-\hat{v}_{\ell}^{\text{attn}}) (-\hat{v}_{\ell}^{\text{attn}})^{\top} \right)$

直觉上看,这个调整能把输出表示在Steering向量上的投影从输出表示中减去。

实验

表2展示了ThinkEdit对推理模型的性能提升。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/5/25 13:12:30

一键智能绑定:让3D角色动起来的简单方法

一键智能绑定:让3D角色动起来的简单方法 【免费下载链接】UniRig One Model to Rig Them All: Diverse Skeleton Rigging with UniRig 项目地址: https://gitcode.com/gh_mirrors/un/UniRig 你是否曾经面对复杂的3D模型,为骨骼绑定而头疼不已&…

作者头像 李华
网站建设 2026/5/25 12:45:29

Common Voice语音数据集实战指南:从入门到精通

Common Voice语音数据集实战指南:从入门到精通 【免费下载链接】cv-dataset Metadata and versioning details for the Common Voice dataset 项目地址: https://gitcode.com/gh_mirrors/cv/cv-dataset 前言:为什么选择Common Voice 如果你正在…

作者头像 李华
网站建设 2026/5/25 14:10:23

团队知识管理困局?这四款开源问答系统让你告别重复劳动

“这个环境怎么搭来着?”、“上次那个活动的配置还记得吗?”、“这个接口报错之前有人遇到过吗?”——如果你也经常被这样的问题轰炸,说明你的团队正面临知识管理的困境。今天我要介绍的这四款开源问答系统,能帮你把零…

作者头像 李华
网站建设 2026/5/24 14:30:53

智能家居安全报警系统的设计(论文+源码)

通过需求分析,本设计智能家居安全报警系统利用单片机控制技术、传感器检测技术、展开设计,如图2.1所示为本次系统设计的主体框图,系统包括单片机主控模块、火焰检测模块、有毒气体检测模块、按键模块、人体检测模块、液晶显示模块、蜂鸣器报警…

作者头像 李华
网站建设 2026/5/26 2:27:40

百度网盘秒传工具完全操作手册:从入门到精通

百度网盘秒传工具完全操作手册:从入门到精通 【免费下载链接】rapid-upload-userscript-doc 秒传链接提取脚本 - 文档&教程 项目地址: https://gitcode.com/gh_mirrors/ra/rapid-upload-userscript-doc 你是否曾经为百度网盘文件转存速度慢而烦恼&#x…

作者头像 李华