原文出处:Introduction to Instruction Tuning with SmolLM3 原作者:Hugging Face · 许可证:Apache-2.0 License 中文译本由诸葛AI学院整理,仅供学习参考,版权归原作者与 Hugging Face 所有。
欢迎来到这门最小巧的微调课!本模块带你上手指令微调(instruction tuning),用的模型是 SmolLM3——Hugging Face 最新的 30 亿参数模型,在同尺寸模型里性能领先,同时轻量易得,适合学习和做实验。
提示 学完这门课,你就能用监督微调(SFT,Supervised Fine-Tuning)训练大语言模型了。这门课体量小,节奏快!如果你想要一条更平缓的学习曲线,可以去看 The LLM Course。
学完本单元(含课后作业)后,别忘了用测验检验一下自己。
什么是指令微调?
指令微调,是把预训练语言模型改造成能遵循人类指令、能进行对话的过程。像 SmolLM3-3B-Base 这样的基座模型,训练目标只是预测下一个令牌(token);而经过指令微调的 SmolLM3-3B 则专门训练了下面这些能力:
- 准确执行用户的指令
- 进行自然的对话
- 给出有用、无害、诚实的回答
- 在多轮交互中保持上下文连贯
- 调用工具或 MCP 服务器完成任务
把一个"续写文本的模型"变成"遵循指令的助手",靠的是在精心整理的数据集上做监督微调。
提示 LLM 课程的这一章对指令微调有详细讲解。
为什么用 SmolLM3 学?
SmolLM3 适合用来学指令微调,理由如下:
- 单张 GPU 就能装下,成本可控
- 性能有竞争力
- 支持多语言对话
- 支持最长 8k 令牌的扩展上下文(部分变体最长可达 128k 令牌)
- 具备双模式推理,支持显式思考
- 公开了完整的训练配方,你能清楚知道它是怎么训出来的
模块总览
这个模块覆盖四块内容。
聊天模板
聊天模板(chat template)是指令微调的地基。它规定了用户和模型之间对话的组织方式,保证回答风格一致、上下文对得上。这一节你将学到:
- SmolLM3 的聊天模板如何工作
- 怎样把一段对话转换成正确的格式
- 如何处理系统提示词(system prompt)和多轮对话
- 如何使用 Transformers 库内置的模板支持
详见聊天模板。
监督微调(SFT)
监督微调是把预训练模型改造成"听得懂指令"的核心技术。这一节要掌握:
- SFT 的原理,以及什么时候该用它
- 处理 SmolTalk2 数据集
- 用 TRL 的
SFTTrainer高效训练 - 数据准备和训练配置上的最佳实践
完整指南见监督微调。
动手练习
由浅入深的练习,把学到的知识用起来:
- 处理指令微调用的数据集
- 在不同任务上微调 SmolLM3
- Python API 和命令行工具两条路都走一遍
- 对比基座模型与微调后模型的表现
练习题和示例都在动手练习。
Hugging Face Jobs
Hugging Face Jobs 是全托管的云端训练基础设施,不用自己搭 GPU、装依赖、配环境,直接在云上训模型。SFT 训练既吃资源又耗时间,用 Jobs 正合适。
完整指南见 Hugging Face Jobs。
你会做出什么
学完本模块,你将:
- 在自己的自定义数据集上微调出一个 SmolLM3 模型
- 理解聊天模板的格式和对话结构
- 同时体验过编程接口和命令行两种训练工作流
- 把一个模型部署到 Hugging Face Hub 上,供他人使用
- 为更进阶的微调技术打好基础
指令微调的世界很有意思,我们出发吧。