大模型怎样从用户反馈中持续自我改进?SLIFT 双适配器选择性自学习框架解析

【技术解读】本文深度解析清华大学与腾讯联合提出的 SLIFT(Selective Self-Learning from User Interactions,arXiv:2608.09109):它把"用户反馈"从整条消息的粗粒度,下沉到原子组件的细粒度,并用一个任务相对(task-relative)的视角给每个组件定性。三步流程——① 原子分解与三元判定:把每条反馈拆成最小可操作原子组件,相对原始任务判为 Fix(构成任务"做对"的刚性前提,应沉淀为默认行为)、Spec(与当前任务兼容但仅在特定条件下适用的补充要求,不该污染默认行为)、Null(模糊矛盾或无法可靠归因正向改进的内容,直接不产生更新);统计显示真实 WildFB 反馈中 Null 高达 37.7%(Fix 19.4% / Spec 42.9%),意味着近四成真实反馈本不该触发任何参数更新;② 双 LoRA 适配器分治:Generalist(通才)通过"反馈条件自蒸馏"把 Fix 类要求固化成默认行为,Specialist(专才)只观察原始任务+Generalist 回答,针对 Spec 细化提供残差引导,不碰全局默认;③ 整个框架建立在 LoRA 之上,不依赖全参数微调,可直接叠加到现有 PEFT 流程,代码已开源。评测侧:Qwen3-8B 在 MemoryBench 样本加权 Norm-Score 达 55.85,显著超过 SDPO(49.56)/SFT(48.63)/DPO(47.81),较 Base(49.17)绝对提升 +6.68 分;Ministral3-14B 上 SLIFT 53.22(较 Base +3.41);WildFB 真实反馈下 IFEval 严格指令遵循与 AlpacaEval 2.0 长度控制均优于各参数基线,MMLU-Pro 知识推理基本持平无显著退化;消融实验显示双通路分工让 Generalist 在 MMLU-Pro 上 ΔG=-0.11、Specialist ΔS=0.00,知识守恒。

用户反馈是金矿,但也是雷区

做过企业级大模型落地的人都知道,模型上线只是开始。真正的持续改进来自用户每天与它交互时产生的反馈——“这里答错了"“这个格式不对"“这个回答应该用术语而不是大白话”。这些信号天然就是监督信号,但把它们直接灌进模型却是个技术雷区。

2026 年 8 月 10 日,清华大学计算机系与腾讯联合团队在 arXiv 提交了论文 Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models(arXiv:2608.09109)。核心洞察很朴素但此前没人系统解决:一条用户反馈消息往往同时要求多种不同的行为改变,而这些改变该"泛化"的范围根本不一样。比如用户说"以后回答都要用中文术语、并且这条具体问题的单位要换算成毫米”——前半句是全局规则(对所有任务生效),后半句只是这条任务的条件细化(仅在此情境下生效)。如果一刀切地全量更新,要么全局规则没固化,要么一次性条件被错误泛化、污染了默认行为。

核心方法:把反馈拆成原子,再分两条管线训练

SLIFT 的做法是把"用户反馈"这件事从整条消息的粗粒度,下沉到原子组件的细粒度,并用一个任务相对(task-relative)的视角给每个组件定性。

第一步,原子分解与三元判定。 系统把每条反馈拆解成最小可操作的原子组件,再相对原始任务把每个组件判为 Fix、Spec 或 Null 三类:

  • Fix(任务合法性要求):构成任务"做对"的刚性前提,应当沉淀为模型的默认行为,对所有同类输入生效;
  • Spec(条件性细化):与当前任务兼容、但只在特定条件下适用的补充要求,不该污染默认行为;
  • Null(无可靠正向更新方向):模糊、矛盾或无法可靠归因到正向改进的内容,直接不产生任何更新。

论文给出的统计很说明问题:在 Qwen3-8B 的 MemoryBench 反馈上,Fix/Spec/Null 的占比是 23.6% / 50.8% / 25.6%;而更真实的 WildFB 用户反馈里 Null 高达 37.7%(Fix 19.4% / Spec 42.9%)。也就是说,接近四成的真实反馈其实不该触发任何参数更新——这正是朴素自学习容易"被一条随手反馈带偏"的根源。

第二步,双 LoRA 适配器分而治之。 SLIFT 在共享的冻结基座上训练两个互补的 LoRA 适配器,把不同范围的改变落到不同参数空间:

  • Generalist(通才):通过"反馈条件自蒸馏”(feedback-conditioned self-distillation)把 Fix 类要求固化成默认行为。它看到的是带反馈标注的训练数据,学习的是"这类任务默认就该这么答"。
  • Specialist(专才):只观察原始任务 + Generalist 的回答,针对那些"适用但 Generalist 尚未满足的 Spec 细化"提供残差引导。它不碰全局默认,只在满足条件时叠加修正。

这一点设计直击持续学习的老问题:把全局规则和一次性条件塞进同一组参数,必然互相干扰、引发灾难性遗忘。SLIFT 用"通才守默认、专才补特例"的分工,让两类信号各得其所。

整个框架不依赖全参数微调,两个适配器都建立在 LoRA 之上,工程上可以直接叠加到现有 PEFT 流程里,代码已开源。

实验数据:记忆与真实反馈双场景领先,知识能力零退化

论文在 Qwen3-8B 与 Ministral3-14B-Instruct 两个基座上,用 MemoryBench(模拟反馈)和 WildFB(1.5 万条真实用户反馈)两套基准做了验证,对比了检索式、外部记忆式与参数训练式多条基线。

MemoryBench(样本加权 Norm-Score,越高越好):

  • Qwen3-8B:SLIFT 达 55.85,显著超过最强参数基线 SDPO(49.56)与 SFT(48.63)、DPO(47.81),相比未适配的 Base(49.17)绝对提升 +6.68 分;仅用 Generalist 的 SLIFT-Gen 也有 51.88,说明 Specialist 额外贡献约 1.8–2.4 分。
  • 分长度区间看,SLIFT 在 Short-Short / Short-Long / Long-Short / Long-Long 四个分区分别拿到 70.49 / 58.00 / 45.22 / 49.68,全部高于所有基线,长文本场景的优势尤其明显。
  • Ministral3-14B:SLIFT 53.22,相比 Base 49.81(+3.41)、相比 SDPO 48.69(+4.53)。

WildFB(真实反馈,由 WildReward-8B 与标准指令遵循基准评测):

  • 在 Qwen3-8B 与 Ministral3-14B 上,SLIFT 的 IFEval 严格指令遵循准确率与 AlpacaEval 2.0 长度控制胜率均优于 Base 及 SFT/DPO/SDPO 等参数基线;WildReward 胜率有微弱正向增益;MMLU-Pro 知识推理精度基本持平,无显著退化

消融实验(Ministral3-14B)进一步坐实了每个组件的必要性:

变体MemoryBenchIFEvalAlpacaEval 2.0
SLIFT(完整)53.2269.7166.35
w/o 原子分解51.3067.8965.22
w/o 任务上下文50.7467.3463.98
w/o 双通路分工51.0567.6264.61
w/o Specialist(仅 Generalist)51.4267.2864.27
w/o KEEP 监督50.8657.6364.06

去掉原子分解或去掉角色分配时的任务上下文,掉点最猛;而 Specialist 把 IFEval 从 67.28 拉到 69.71、AlpacaEval 从 64.27 拉到 66.35。更关键的是知识守恒:Generalist 在 MMLU-Pro 上的变化仅 ΔG = -0.11,Specialist 更是 ΔS = 0.00——双适配器分工让模型在吸收用户反馈的同时,没有牺牲已有的通用知识推理能力

需要说明边界:WildFB 中"完全可用的反馈率"只有 50.4%(标准化后 96.7%),意味着真实反馈里近一半信号质量不足,这也是真实反馈增益相对 MemoryBench 偏小的原因;论文未包含"全参数微调"与"标准独立 LoRA"的直接对比,因此 SLIFT 的优势是针对自学习/自蒸馏这一类持续学习基线而言的。

商业启示:把"用户反馈闭环"做成可交付的工程能力

对思陌大模型微调的客户项目,这篇论文指向一个常被忽略但越来越重要的交付环节——上线后的自我进化能力

指令对齐(指令微调/SFT/DPO)需要引入"反馈分级"机制。 我们给客户做对齐时,训练数据大多来自一次性标注,缺少"用户上线后持续纠错"这条活水。SLIFT 的 Fix/Spec/Null 三元判定可以直接变成我们的数据工程流水线:把客户运营团队每天的人工纠错自动分级,Fix 类沉淀进通用 SFT 集、Spec 类走条件化适配、Null 类直接过滤。这能显著降低"一句话反馈把模型带偏"的线上事故概率。

数据工程环节可借双适配器实现"热更新不回退"。 企业客户最怕的是:为修一个 bug 重新全量微调,结果把上周刚对齐好的能力冲掉。SLIFT 的 Generalist 守默认、Specialist 补特例的分工,本质上就是一套"增量热补丁"范式——可以用 LoRA 叠加实现零回退的能力追加,这与我们给客户做持续交付(而非每次推倒重来)的诉求高度契合。

评估优化环节要把"知识守恒"设为回归门禁。 论文里 MMLU-Pro 零退化的结果提示我们:任何一次基于反馈的再训练,都必须跑一遍通用能力回归测试,防止局部优化悄悄侵蚀全局能力。这应成为我们交付流程里的一道固定质检项。

推理部署层面,SLIFT 不增加推理架构复杂度(仍是 LoRA 叠加,无常驻双模型),意味着我们现有的推理服务栈无需为"支持持续自学习"做额外改造——这是一个对交付友好、成本可控的方案。


参考文献

  1. Li, X., Li, H., Zhou, Y., Pan, Q., Wang, H., Liu, Y., Zhang, M., & Ai, Q. (2026). Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models. arXiv: 2608.09109 | DOI: 10.48550/arXiv.2608.09109
  2. 论文开源代码仓库:SLIFT (4open.science)

本文为思陌大模型微调团队对公开论文的独立解读,数据与结论均以原文为准,不代表原作者观点。

论文原文信息链接:大模型怎样从用户反馈中持续自我改进?SLIFT 双适配器选择性自学习框架解析

(注:本文由 AI 辅助生成,仅对论文做独立解读,不代表原文作者观点。)

内容概要:本文档是一份针对全国大学生电子设计竞赛(NUEDC)的“保姆级”实战指导手册,系统涵盖赛题解析与方案库、模块化代码与电路实现、以及测试报告范例三大核心部分。手册深入剖析了电赛七大赛题类别及其命题规律,强调“基本要求+发挥部分”的结构特点、指标逐年收紧趋势及测量与控制复合型题目的增加。通过数控直流电流源和频率特性测试仪两个典型案例,展示了从系统方案设计、关键器件选型到软硬件实现的完整路径。同时,提供了基于STM32 HAL库的ADC采样、PWM生成、OLED显示、无线通信等常用模块的详细电路原理与驱动代码,并辅以测试报告范例和评分标准解析,帮助参赛者规范撰写高质量设计报告。; 适合人群:参加全国大学生电子设计竞赛的本科生及指导教师,尤其适合有一定单片机和电路基础、希望在短时间内高效备赛并提升获奖概率的团队。; 使用场景及目标:①帮助参赛者快速掌握电赛命题规律与主流技术方案,精准应对电源类、控制类、仪器仪表类等高频赛题;②提供可复用的模块化代码与电路设计,加速硬件搭建与软件开发进程;③指导撰写符合评审标准的设计报告,强化误差分析与测试数据呈现,提升综合得分。; 阅读建议:建议按照“赛题分析→方案设计→模块实现→报告撰写”的流程顺序阅读,重点学习典型案例的整体设计思路与关键器件选型依据。对于代码与电路部分,应在实际开发板上动手验证,结合示波器、逻辑分析仪等工具进行调试。撰写报告时,务必参考文中测试表格与误差分析模板,确保数据完整、分析定量,避免因报告不规范而失分。;
内容概要:本文系统介绍了基于投资组合CVaR(条件风险价值)对象的金融投资组合优化方法,重点阐述了利用Matlab代码实现CVaR风险度量下的资产配置优化过程。相较于传统VaR仅衡量特定置信水平下的最大损失,CVaR进一步评估超出该阈值的平均尾部损失,具有更好的数学性质如凸性和次可加性,更适用于构建可优化的数学模型。文中详细讲解了CVaR优化模型的理论基础、目标函数设计、约束条件设置以及Matlab金融工具箱中PortfolioCVaR类的具体应用步骤,并结合实证案例演示了如何加载资产数据、设定预期收益率与风险偏好、执行优化求解及分析有效前沿,帮助投资者在控制极端下行风险的前提下实现最优资产配置。; 适合人群:具备一定金融工程、数量经济学或风险管理背景,熟悉Matlab编程环境,正在从事量化投资、资产配置建模、金融产品设计等相关工作的研究人员、高校师生及金融机构从业人员。; 使用场景及目标:①用于金融机构构建高阶风险管理导向的投资组合,提升对尾部风险的防控能力;②支持学术研究中对不同风险度量模型(如VaR与CVaR)在组合优化中表现差异的实证比较;③辅助教学实践中开展现代投资组合理论与高级风险控制技术相结合的编程实训课程。; 阅读建议:建议读者结合Matlab平台动手复现文中的代码示例,深入理解CVaR优化模型的构建逻辑与求解流程,并尝试调整资产数据、置信水平和约束条件以观察优化结果的变化,从而掌握其在真实投资决策中的灵活应用技巧。
标题基于SpringBoot的学生读书笔记共享平台设计研究AI更换标题第1章引言介绍学生读书笔记共享平台的研究背景、意义、国内外研究现状、论文方法以及创新点。1.1研究背景与意义阐述学生读书笔记共享平台在当前教育环境下的重要性。1.2国内外研究现状分析国内外学生读书笔记共享平台的研究进展与现状。1.3研究方法及创新点概述本文的研究方法与平台设计的创新点。第2章相关理论总结和评述与SpringBoot及读书笔记共享平台相关的理论。2.1SpringBoot框架介绍阐述SpringBoot框架的特点、优势及其在Web开发中的应用。2.2读书笔记共享平台相关理论介绍读书笔记共享平台的设计原则、功能需求及用户体验理论。2.3数据库设计与优化理论简述数据库设计的基本原则及优化策略。第3章平台设计详细介绍基于SpringBoot的学生读书笔记共享平台的设计方案。3.1平台架构设计平台的整体架构,包括前端、后端及数据库的设计。3.2功能模块设计阐述平台的主要功能模块,如用户管理、笔记上传、笔记分享等。3.3数据库设计介绍数据库的设计方案,包括表结构、索引及关系设计。第4章平台实现详细描述平台的具体实现过程,包括技术选型、开发环境搭建等。4.1技术选型与开发环境介绍开发平台所采用的技术栈及开发环境配置。4.2关键代码实现展示平台实现过程中的关键代码片段,如用户登录、笔记上传等功能的实现。4.3平台测试与优化平台的测试过程及优化策略,确保平台的稳定性和性能。第5章平台应用与分析对平台的应用效果进行分析,包括用户反馈、使用数据等。5.1用户反馈收集与分析收集用户反馈,分析用户对平台的满意度及改进建议。5.2使用数据分析通过数据分析工具,分析平台的使用情况,如用户活跃度、笔记分享量等。5.3对比方法分析对比其他类似平台,分析本平台的优势与不足。第6章结论与展望总结本文的研究成果,并对未来研究方向
上市公司人工智能技术应用水平主要用于衡量企业在人工智能技术研发、应用部署、业务融合以及战略布局方面的程度 学术界主要采用以下方法测度上市公司人工智能技术应用水平: 第一,人工智能专利测度法:基于企业技术创新产出视角,通过识别上市公司专利申请或授权信息中的人工智能相关专利,利用企业年度人工智能专利数量衡量其人工智能技术研发能力与技术积累水平 第二,年报文本分析法:基于企业信息披露视角,通过构建人工智能关键词词典,提取上市公司年度报告、管理层讨论与分析(MD&A)等文本中人工智能相关词汇出现频次,并对词频进行对数化处理,以衡量企业人工智能技术关注程度和应用水平 第三,机器人渗透度测度法:主要从智能化生产应用角度出发,利用行业层面的工业机器人安装密度,并结合企业所在行业特征、就业结构等信息,推算企业层面的自动化和人工智能技术渗透程度 第四,综合指数法:从人工智能投资、专利、关键词词频、机器人应用、人工智能项目等多维度构建指标体系,构建综合指数 第五,智能化投资测度法:基于人工智能软件投资额、人工智能硬件投资额之和占总资产的比例来衡量企业人工智能基础设施建设和技术应用水平 参考李果和白云朴(2024)、闫文影和陈雨生(2026)的研究思路,本文从企业人工智能技术实际投入角度衡量上市公司人工智能应用水平。具体而言,基于上市公司年度报告财务附注信息,通过关键词识别方法提取人工智能相关软件投资和硬件投资,并将二者加总形成企业人工智能投资规模,进一步以人工智能投资额占企业总资产的比例衡量企业人工智能技术应用水平 一、数据介绍 数据名称:上市公司人工智能技术应用水平 数据范围:上市公司企业 时间范围:2007-2025年 样本数量:78325条 数据来源:上市公司年报 二、数据指标 年份 股票代码 股票简称 行业名称 行业代码 省份
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值