首页 / 资料库 / Hugging Face · 小模型课

资料库9 分钟读完Apache-2.0微调Hugging Face小模型课

用 SmolLM3 入门指令微调

译自《Introduction to Instruction Tuning with SmolLM3》 · 查看英文原文

原文出处Introduction to Instruction Tuning with SmolLM3 原作者:Hugging Face · 许可证:Apache-2.0 License 中文译本由诸葛AI学院整理,仅供学习参考,版权归原作者与 Hugging Face 所有。

欢迎来到这门最小巧的微调课!本模块带你上手指令微调(instruction tuning),用的模型是 SmolLM3——Hugging Face 最新的 30 亿参数模型,在同尺寸模型里性能领先,同时轻量易得,适合学习和做实验。

提示 学完这门课,你就能用监督微调(SFT,Supervised Fine-Tuning)训练大语言模型了。这门课体量小,节奏快!如果你想要一条更平缓的学习曲线,可以去看 The LLM Course

学完本单元(含课后作业)后,别忘了用测验检验一下自己。

什么是指令微调?

指令微调,是把预训练语言模型改造成能遵循人类指令、能进行对话的过程。像 SmolLM3-3B-Base 这样的基座模型,训练目标只是预测下一个令牌(token);而经过指令微调的 SmolLM3-3B 则专门训练了下面这些能力:

  • 准确执行用户的指令
  • 进行自然的对话
  • 给出有用、无害、诚实的回答
  • 在多轮交互中保持上下文连贯
  • 调用工具或 MCP 服务器完成任务

把一个"续写文本的模型"变成"遵循指令的助手",靠的是在精心整理的数据集上做监督微调。

提示 LLM 课程的这一章对指令微调有详细讲解。

为什么用 SmolLM3 学?

SmolLM3 适合用来学指令微调,理由如下:

  • 单张 GPU 就能装下,成本可控
  • 性能有竞争力
  • 支持多语言对话
  • 支持最长 8k 令牌的扩展上下文(部分变体最长可达 128k 令牌)
  • 具备双模式推理,支持显式思考
  • 公开了完整的训练配方,你能清楚知道它是怎么训出来的

模块总览

这个模块覆盖四块内容。

聊天模板

聊天模板(chat template)是指令微调的地基。它规定了用户和模型之间对话的组织方式,保证回答风格一致、上下文对得上。这一节你将学到:

  • SmolLM3 的聊天模板如何工作
  • 怎样把一段对话转换成正确的格式
  • 如何处理系统提示词(system prompt)和多轮对话
  • 如何使用 Transformers 库内置的模板支持

详见聊天模板

监督微调(SFT)

监督微调是把预训练模型改造成"听得懂指令"的核心技术。这一节要掌握:

  • SFT 的原理,以及什么时候该用它
  • 处理 SmolTalk2 数据集
  • 用 TRL 的 SFTTrainer 高效训练
  • 数据准备和训练配置上的最佳实践

完整指南见监督微调

动手练习

由浅入深的练习,把学到的知识用起来:

  • 处理指令微调用的数据集
  • 在不同任务上微调 SmolLM3
  • Python API 和命令行工具两条路都走一遍
  • 对比基座模型与微调后模型的表现

练习题和示例都在动手练习

Hugging Face Jobs

Hugging Face Jobs 是全托管的云端训练基础设施,不用自己搭 GPU、装依赖、配环境,直接在云上训模型。SFT 训练既吃资源又耗时间,用 Jobs 正合适。

完整指南见 Hugging Face Jobs

你会做出什么

学完本模块,你将:

  • 在自己的自定义数据集上微调出一个 SmolLM3 模型
  • 理解聊天模板的格式和对话结构
  • 同时体验过编程接口和命令行两种训练工作流
  • 把一个模型部署到 Hugging Face Hub 上,供他人使用
  • 为更进阶的微调技术打好基础

指令微调的世界很有意思,我们出发吧。

参考资料

这篇在讲什么,跟咱们的课怎么对?

资料库是大厂公开教材的中文译本,偏原理和工程做法。想看面向中小企业的白话版本,去入门课场景课