首页 / 资料库 / Hugging Face · 小模型课

资料库5 分钟读完Apache-2.0偏好对齐Hugging Face小模型课

偏好对齐入门

译自《Introduction to Preference Alignment with SmolLM3》 · 查看英文原文

原文出处Introduction to Preference Alignment with SmolLM3 原作者:Hugging Face · 许可证:Apache-2.0 License 中文译本由诸葛AI学院整理,仅供学习参考,版权归原作者与 Hugging Face 所有。

SmolLM3 偏好对齐入门

欢迎来到这门"最小号"微调课程的第三单元!本单元会带你上手偏好对齐(preference alignment),模型用的是 SmolLM3,基础则是第一单元指令微调(instruction tuning)的练习成果。你将学会怎么用直接偏好优化(Direct Preference Optimization,DPO)把语言模型对齐到人类偏好,做出更有帮助、更无害、更诚实的 AI 助手。

提示:学完本单元,你就能用 DPO 让大模型对齐人类偏好。这门课虽小,节奏却快。如果你想要一条更平缓的学习曲线,可以去看 The LLM Course。 学完本单元(并完成作业)后,别忘了做测验检验一下自己。

什么是偏好对齐?

监督微调(supervised fine-tuning,SFT)教会模型听从指令、进行对话;偏好对齐则往前走了一步,训练模型生成符合人类偏好的回答。它要做的,是让 AI 系统贴合人真正想要的东西,而不是照字面死板执行指令。简单说,它让语言模型在真实世界的应用里更好用。

偏好对齐能应对 AI 开发中的几道关键难题。经过偏好对齐训练的模型,行为会在多个方面变好:生成的有害、带偏见或不恰当的回答更少,输出更有用、更贴近人的真实需求;回答更真实,幻觉(hallucination)更少,也更贴合人类的价值观与伦理。总体来看,偏好对齐后的模型在连贯性、相关性和回答质量上都更好。

提示:想更细地了解对齐技术,可以读 DPO 论文,就是提出 DPO 的那篇原始论文。

直接偏好优化(DPO)

DPO 把偏好对齐的做法彻底改写了:不再需要单独的奖励模型(reward model),也不再需要复杂的强化学习(reinforcement learning)。本单元我们就来了解这一前沿技术,学用它把语言模型对齐到人类偏好。

DPO 的对齐流程,比"基于人类反馈的强化学习"(Reinforcement Learning from Human Feedback,RLHF)的对齐流程简单得多。整个过程分两个主要阶段:

  1. 先用监督微调,让基座模型(base model)学会听从指令。
  2. 再用偏好数据,通过直接偏好优化直接对模型做优化。

这套精简的打法,让你不用单独的奖励模型、不用复杂的强化学习,就能拿偏好数据做训练,效果持平甚至更好。如果你是第一次接触 RLHF,不用担心,课程后面会详细回顾它,再对比它和 DPO 的差别。

本单元的练习仍然用 SmolLM3 来做偏好对齐。模型既可以用指令微调好的现成版本,也可以用第一单元练习的产出。

你将做出什么

这一单元全程动手,你会练出偏好对齐的实操能力。你将学会在偏好数据集上用 DPO 训练 SmolLM3:

  • 掌握 DPO 超参数的配置与调优方法。
  • 把 DPO 的结果与指令微调基线模型做对比。
  • 用标准基准测试评估模型的安全性与对齐质量。
  • 把你的对齐模型提交到课程排行榜。
  • 最后,探索怎么把对齐后的模型部署到实际应用中。

准备好用 DPO 让你的模型更贴合人类偏好了吗?开始吧!

这篇在讲什么,跟咱们的课怎么对?

资料库是大厂公开教材的中文译本,偏原理和工程做法。想看面向中小企业的白话版本,去入门课场景课