当前位置:首页 > AI资讯 > 正文内容

多模态大模型SFT竟成RL绊脚石

admin3个月前 (05-17)AI资讯128

多模态大模型的“隐形伤”:SFT之后,RL真的在进步吗?

在人工智能领域,多模态大模型(MLLM)的训练范式长期以来被简化为一条看似高效的流水线:先通过监督微调(SFT)让模型“学会说话”,再通过强化学习(RL)让它“说得更好”。从DeepSeek到Qwen,从GRPO到DAPO,业界不断打磨RL算法的稳定性与效率,却鲜有人质疑这条路径的起点是否真的稳固。

然而,最新研究《Beyond SFT-to-RL》(PRISM团队)揭示了一个令人警醒的事实:SFT不仅没有为RL铺路,反而在悄悄挖坑。许多模型在SFT阶段就已经“带伤训练”,而后续的强化学习,可能只是在努力“还债”,而非真正提升能力。

SFT的“副作用”:性能为何不升反降?

一组来自Qwen3-VL系列模型的实验数据极具说服力。在7个主流多模态基准测试中,模型在SFT后的平均准确率不增反降:

  • Qwen3-VL-4B:从59.7%降至56.8%(-3.0)
  • Qwen3-VL-8B:从63.3%降至58.1%(-5.2)

更令人惊讶的是,即使后续引入GRPO强化学习,8B模型也仅勉强回升至63.3%——刚好回到原始Instruct模型的水平。这意味着,RL阶段所做的努力,可能只是弥补了SFT造成的损伤,而非实现真正的能力跃迁。

这种现象并非个例。研究发现,当SFT使用的数据分布与基座模型原有能力分布不一致时(例如使用GPT或Gemini生成的蒸馏数据),模型极易出现“能力覆盖”问题:新知识挤占了旧知识的表达空间,而真正关键的推理能力却被稀释

两类被忽视的偏差:SFT为何“好心办坏事”?

SFT在多模态场景下的问题,源于两种深层偏差:

偏差一:表面模仿 vs 真实推理

SFT的优化目标是在token级别上最小化损失,这意味着模型对“推理过程”和“输出格式”一视同仁。例如,模型可能更倾向于学习“因为A所以B”这类模板化表达,而非真正理解图像中的视觉线索与逻辑链条。结果是:模型学会了“看起来正确”,而非“真正正确”

偏差二:感知漂移与推理漂移的混淆

多模态模型的失败模式具有双重性:

  • 感知漂移:模型“看错了”,例如误判图像中的物体位置或属性。
  • 推理漂移:模型“想歪了”,例如逻辑推导错误或因果颠倒。

这两种问题成因不同,纠正方式也应不同。但SFT用一个统一的token loss同时拟合,导致模型在感知和推理两端同时偏移,形成“既看不准、又想不对”的复合缺陷。

RL的局限:跑得快,但起点在坑里

当前主流的RL算法(如GRPO、DAPO、GSPO)确实在采样效率、梯度稳定性等方面取得了显著进步。但它们的核心假设是:模型已经处于一个合理的分布起点

现实却是,SFT已将模型推离了最优起点。这就像百米赛跑中,选手被SFT向后推了50米,而RL算法只关心如何跑得更快,却没人把他拉回起跑线。

PRISM的破局之道:三阶段流水线

PRISM团队提出了一种全新的三阶段训练范式:

SFT → 分布对齐(PRISM)→ RLVR

其核心创新在于中间的“分布对齐”阶段,旨在修复SFT引入的分布偏移。

混合专家判别器(MoE Discriminator)

PRISM引入了一个双专家判别器,分别针对感知漂移和推理漂移进行建模:

  • 感知专家:专注于视觉 grounding 的准确性,判断模型是否“看对了”。
  • 推理专家:评估逻辑链条的合理性,判断模型是否“想对了”。

通过这两个专家的协同判断,PRISM能够精准识别模型在哪个环节出错,并引导后续训练进行针对性修复,避免“一刀切”式的优化。

此外,PRISM还采用了一种动态重加权机制,在训练过程中自动调整不同样本的损失权重,优先纠正分布偏移最严重的样本,从而加速模型回归到真实能力分布。

结语:训练范式需要重新校准

多模态大模型的训练远非“SFT+RL”的简单叠加。当模型能力越强,SFT带来的分布偏移风险就越高。PRISM的研究提醒我们:在追求RL效率之前,必须先填平SFT挖下的“隐形断层”

未来的后训练范式,不应只是“跑得更快”,而应首先确保“站在正确的起点”。唯有如此,强化学习才能真正释放其潜力,而非沦为一场漫长的“还债之旅”。

标签: 多模态大模型 SFT 强化学习 分布偏移 PRISM

相关文章

AI自主玩手机!ClawGUI打通训练评测部署全流程

当AI开始“玩手机”:从消消乐到真机操控的跨越 你见过AI自己玩消消乐吗?没有脚本、没有人工干预,它只是静静地看着屏幕,识别图案、规划路径、点击消除——整个过程流畅得如同一个熟练的玩家。更令人惊讶的是...

AI听懂猫狗语:PettiChat用世界模型破译宠物心声

当AI开始“听懂”猫言狗语:PettiChat如何用世界模型打破人宠沟通壁垒 在通用人工智能(AGI)席卷人类语言世界的今天,一个长期被忽视的沟通场景正悄然迎来技术破局——人类与宠物之间的交流。尽管全...

AI智慧源于数据上下文

AI 的“智慧”取决于数据的“上下文” 人工智能在企业中的应用正以前所未有的速度从实验走向日常。如今,越来越多的组织开始在财务、供应链、人力资源和客户运营等关键业务中部署 AI 副驾驶(copilot...

原生智驾模型重塑自动驾驶未来

从“大脑”到“躯干”:原生智驾基座模型如何重塑自动驾驶的未来 当大模型浪潮席卷各行各业,人工智能正加速从虚拟世界走向物理终端。然而,在智能汽车与具身智能的探索中,一个关键瓶颈逐渐浮现:“大脑”与“躯干...

AI员工激增,企业安全亟需身份认证

当AI成为“员工”,企业安全需要一张「身份证」 OpenClaw 掀起的智能体浪潮,正将人工智能从辅助工具转变为真正意义上的“硅基员工”。越来越多的企业开始部署 AI Agent,让它们参与代码生成、...

GPT-5.5 实现智能跃迁,AI 主动执行任务

智能跃迁:从 GPT-5.5 的“省流”进化到 Meta 的“读心”实验 人工智能的发展正以前所未有的速度重塑我们的工作与生活方式。本周,科技巨头们接连抛出重磅消息,从更聪明、更省资源的语言模型,到企...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。