news 2026/5/25 10:19:06

AlignGuard-LoRA:一种结合了高效微调和安全保护的新正则化方法

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AlignGuard-LoRA:一种结合了高效微调和安全保护的新正则化方法

总结

低秩自适应性(LoRA)被广泛用于微调大型语言模型,其优点是效率高、计算资源少。

但与此同时,它也存在一个明显的问题,那就是破坏了 “对齐”,而 "对齐 "是为了维护安全性和道德约束。

具体来说,会出现毒性声明增加、过度拒绝和偏差恶化等情况,从而降低模型的可靠性。

AlignGuard-LoRA 通过使用费雪信息矩阵进行正则化来控制对齐敏感的方向,从而实现任务适应和安全保护。

此外,它还利用特定任务的正则化来稳定更新,并通过引入基于黎曼几何和大地距离的 “避免碰撞正则化”,从几何角度将对齐相关更新与任务相关更新分离开来。
经证明,与传统的 LoRA 相比,所提出的方法可实现高达 50%的漂移抑制,同时提高了安全性和性能。

拟议方法

AlignGuard-LoRA 的结构是将 LoRA 的低秩更新分解为 "对齐相关部分 "和 “任务特定部分”,并对每个部分应用不同的正则化。

首先,添加基于费雪信息矩阵的惩罚,以抑制对齐敏感方向上的过度更新。

这使得剔除精度和毒性控制等安全行为更容易保持。

接下来,针对特定任务组件引入了 “信任域正则化”,以稳定低熵域的学习。

最重要的是 “避免碰撞正则化”。

它结合了黎曼距离的每坐标干扰抑制和大地距离的几何方向分离,以防止对齐和任务更新之间的干扰。

这三种正则方法相辅相成,旨在将任务适应性和安全性结合起来。
它们缓解了传统 LoRA 中的权衡问题,即通过降低安全性来换取任务准确性的提高,并允许在保持低等级和高效学习的同时,进行不干扰对齐的微调。

实验

实验比较了标准 LoRA、提议的 AlignGuard-LoRA 以及使用 LLaMA 3 (7B) 模型对所有参数进行的全面微调。
评估指标包括一般任务(如 GLUE 和 SuperGLUE)、安全性和鲁棒性基准(如 HELM 和 AdvGLUE)以及毒性(RealToxicityPrompts)、拒绝行为(OR-Bench)和偏差(CrowS-Pairs, BBQ)。使用了多方面的标准。

结果,与标准 LoRA 相比,AlignGuard-LoRA 大幅减少了毒性和偏差,并保持了排斥的准确性。
特别是完整版,在增加了避免碰撞正则化后,其性能与完全微调版相当,甚至更好,同时还保持了其在安全指标方面的优势。

顺序消融实验也证实,基于费舍尔的正则化、特定任务正则化和避免碰撞正则化各自有效,将它们结合在一起会产生协同效应。
此外,在一项名为 DRIFTCHECK 的新基准测试中,AlignGuard 的安全性能降低了 50%,证明了其作为安全关键领域微调方法的有效性。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/5/25 8:38:35

从虚拟机权限到网络配置:WinApps实战问题全解析

从虚拟机权限到网络配置:WinApps实战问题全解析 【免费下载链接】winapps The winapps main project, forked from https://github.com/Fmstrat/winapps/ 项目地址: https://gitcode.com/GitHub_Trending/wina/winapps 当你满怀期待地准备在Linux系统上无缝运…

作者头像 李华
网站建设 2026/5/25 7:15:57

微软商店封神工具!Photo Retouch,AI 抠图删物一键搞定

谁还在为修图头疼?想删图片里的路人、杂物,用复杂软件抠半天还留痕迹;抠图后白边难消、背景单调,新手看教程都看晕 —— 直到我挖到这款微软应用商店的宝藏工具,小白也能秒变修图大神! 下载地址&#xff1…

作者头像 李华
网站建设 2026/5/26 0:41:47

人工神经网络(2025年秋):第五次作业

◎ 说明: 作业可以使用你所熟悉的编程语言和平台,比如 C,C、MATLAB、Python等。作业链接。 01 深度网络一、作业内容 1、作业要求 练习搭建深度学习网络基本网络(CNN)实现数据分类与参数回归;掌握深度学习…

作者头像 李华
网站建设 2026/5/26 6:16:09

完整USB嗅探器使用指南:5步快速上手低成本USB流量分析

完整USB嗅探器使用指南:5步快速上手低成本USB流量分析 【免费下载链接】usb-sniffer Low-cost LS/FS/HS USB sniffer with Wireshark interface 项目地址: https://gitcode.com/gh_mirrors/us/usb-sniffer 想要深入了解USB设备的通信过程吗?USB S…

作者头像 李华
网站建设 2026/5/26 6:58:00

Qwen3-30B-A3B模型在Ascend平台的深度技术解析

Qwen3-30B-A3B模型在Ascend平台的深度技术解析 【免费下载链接】Qwen3-30B-A3B-Instruct-2507-FP8 项目地址: https://ai.gitcode.com/hf_mirrors/Qwen/Qwen3-30B-A3B-Instruct-2507-FP8 技术架构亮点速览 Qwen3-30B-A3B作为新一代智能推理引擎,采用创新的…

作者头像 李华
网站建设 2026/5/26 6:56:57

【干货收藏】手把手教你申请软件著作权,一篇搞定全流程!

还在为申请软著头疼?别急!这份超详细攻略带你轻松走完所有流程,从注册到拿证,一步都不少!第一步:注册与实名 先登录「中国版权保护中心」官网,注册账号并完成实名认证,这是申请的第一…

作者头像 李华