首页 / 资料库 / 微软 · 生成式 AI 入门

资料库15 分钟读完MIT生成式AI大语言模型入门

生成式 AI 与大语言模型入门

译自《Introduction to Generative AI and Large Language Models》 · 查看英文原文

原文出处Introduction to Generative AI and Large Language Models 原作者:Microsoft · 许可证:MIT License 中文译本由诸葛AI学院整理,仅供学习参考,版权归原作者与微软所有。

生成式 AI 与大语言模型入门

本课配有讲解视频,可在此观看:https://youtu.be/lFXQkBvEe0o

生成式人工智能(Generative AI)指能够生成文本、图片等各类内容的 AI。它之所以是一项了不起的技术,在于它把 AI 的使用门槛拉到了人人可用:只要一句用自然语言写成的提示词(prompt)就够了。你不必去学 Java 或 SQL 这类编程语言,用你自己的语言说清楚想要什么,AI 模型就会给出建议。它能带来的应用和影响是巨大的:写报告、读懂报告、写应用程序,许多事情几秒钟就能完成。

在这套课程里,我们会围绕一家虚构的创业公司展开,看它如何用生成式 AI 打开教育领域的新场景,也会直面两个绕不开的问题:这项技术应用带来的社会影响,以及技术本身的局限。

引言

本课内容包括:

  • 业务场景导入:我们的创业点子和使命。
  • 生成式 AI,以及它是如何走到今天这个技术格局的。
  • 大语言模型(Large Language Model,LLM)的内部工作机制。
  • 大语言模型的主要能力和实际用例。

学习目标

学完这一课,你将理解:

  • 什么是生成式 AI,大语言模型是如何工作的。
  • 怎样把大语言模型用到不同场景中,重点是教育场景。

场景:我们的教育创业公司

生成式 AI 处在 AI 技术的顶端,把过去被认为不可能的事情一件件变成可能。它有相当多的能力和应用方向,但在这套课程里,我们通过一家虚构的创业公司,来看它正在怎样变革教育。下文就称这家企业为"我们的创业公司"。它身处教育行业,使命宣言写得很大:

在全球范围内改善学习的可及性,确保人人享有平等的教育机会,按每个学习者的需要提供个性化学习体验

创业团队心里清楚:这个时代最有威力的工具之一是大语言模型,不用上它,这个目标就别想实现。

业界普遍预期,生成式 AI 会重塑今天教与学的方式:学生身边等于有了 24 小时在线的虚拟老师,随时提供大量知识和示例;老师也能借助新工具来评估学生、给出反馈。

先定义几个贯穿整套课程的基本概念和术语。

生成式 AI 是怎么来的?

尽管最近生成式 AI 模型的发布引发了非同寻常的_炒作_,这项技术其实积累了几十年,最早的研究可以追溯到上世纪 60 年代。我们如今走到了 AI 具备人类认知能力这一步,比如对话能力,OpenAI ChatGPTMicrosoft Copilot 都是例子,后者同样基于 GPT 模型来做对话式的网页搜索。

往回看,AI 的最早原型是靠敲定规则写出来的聊天机器人:把一组专家的知识提炼成知识库存进计算机,输入文本里出现关键词,就触发知识库里的对应回答。但很快人们发现,这种靠手写规则的聊天机器人撑不起规模。

AI 的统计学路线:机器学习

转折点出现在 90 年代,统计学方法被应用到文本分析上,催生了一批新算法,也就是机器学习(machine learning):不需要显式编程,就能从数据中学出规律。这条路线让机器可以模拟人类对语言的理解:用"文本-标签"配对数据训练一个统计模型,模型就能给没见过的输入文本打上预定义的标签,标签代表这条消息的意图。

神经网络与现代虚拟助手

近些年,硬件技术进步了,能处理更大的数据量和更复杂的计算,AI 研究随之升温,发展出更高级的机器学习算法,即神经网络(neural networks)或深度学习(deep learning)算法。

神经网络(特别是循环神经网络,Recurrent Neural Network,RNN)大幅改善了自然语言处理,让文本的语义得到更贴切的表示,能顾及一个词在句中的上下文。

正是这项技术支撑了新世纪头十年诞生的虚拟助手:它们很擅长理解人话,识别需求,再做出动作去满足需求,比如按预设脚本回答,或者调用第三方服务。

如今:生成式 AI

于是就有了今天的生成式 AI,可以把它看作深度学习的一个子集。

原文此处有一张图,画的是四层的包含关系:生成式 AI 属于深度学习,深度学习属于机器学习,机器学习属于人工智能(AI)。

在 AI 领域经过数十年研究之后,一种叫 Transformer 的新模型架构突破了 RNN 的局限,能够接收长得多的文本序列作为输入。Transformer 建立在注意力机制(attention mechanism)之上,模型可以给不同输入分配不同权重,把"注意力"多放在关键信息集中的地方,不管这些信息在文本序列里排第几。

最近一代的生成式 AI 模型大多基于这一架构。它们处理的输入输出都是文本,因此也被称为大语言模型(LLM)。这类模型有个有意思的地方:它们用海量无标注数据训练,来源五花八门,书籍、文章、网页都有,却能适配各种各样的任务,生成语法正确、看似有创造力的文本。机器的"理解"输入文本的能力因此大幅增强,它们还获得了另一种能力:用人类语言生成原创回答。

大语言模型如何工作?

下一章我们会介绍生成式 AI 模型的各个类型,这里先看大语言模型内部是怎么运转的,以 OpenAI 的 GPT(Generative Pre-trained Transformer,生成式预训练变换器)系列为例。

  • Tokenizer,把文本变成数字:大语言模型输入是文本,输出也是文本。但它本质是统计模型,处理数字远比处理文本序列在行。所以每一份输入在进入核心模型之前,都要先经过 tokenizer(分词器)处理。令牌(token)是一段文本块,包含的字符数不固定,tokenizer 的主要任务就是把输入切成一个令牌数组。然后每个令牌映射到一个令牌索引,也就是原文本块对应的整数编码。

  • 预测输出令牌:给定 n 个令牌的输入(n 的上限因模型而异),模型能预测出一个令牌作为输出。这个令牌随即并入下一轮迭代的输入,窗口像滚雪球一样扩大,用户就能得到一句或几句完整的回答。这也解释了为什么你用 ChatGPT 时偶尔会发现:它好像说到一半就停住了。

  • 选择过程,概率分布:输出令牌怎么选?模型按它在当前文本序列之后出现的概率来挑。模型会基于训练结果,对所有可能的"下一个令牌"算出一个概率分布。但选出来的未必是概率最高的那个。这个选择过程带有一定随机性,模型的行为因此是非确定性的:同一个输入,不会总得到同一个输出。加入随机性是为了模拟创造性思考的过程,可以通过一个叫温度(temperature)的模型参数来调节。

我们的创业公司怎么用大语言模型?

了解了大语言模型的内部机制,再看一些实际例子。它们最拿手、也最常见的任务有哪些?结合我们的业务场景来看。前面说过,大语言模型的核心能力是_从一段自然语言输入出发,凭空生成文本_。

那输入和输出具体长什么样?

大语言模型的输入叫提示词(prompt),输出叫补全(completion)。这个名字来源于模型的工作机制:不断生成下一个令牌,把当前输入补完整。提示词是什么、怎么设计才能把模型的潜力榨出来,后面会专门展开。这里先知道提示词可以包含这些成分就够了:

  • 一条指令,说明你期望模型输出什么。指令里有时还会嵌一些示例或附加数据。
  1. 摘要:给一篇文章、一本书、产品评论之类做总结,或从无结构数据中提炼要点。

  2. 创意写作:为文章、随笔、作业等出点子、做设计。

  • 一个问题,以同智能体对话的形式提出。

  • 一段待续文本,言下之意是请模型帮忙往下写。

  • 一段代码,配上"解释它、给它写文档"的要求;或者一段注释,要求模型生成实现特定任务的代码。

上面的例子都很简单,也无意穷举大语言模型的全部能力。它们想说明的是生成式 AI 的潜力,重点在教育场景,但不限于教育场景。

还要说一句:生成式 AI 模型的输出并不完美,有时模型的创造力会反噬它自己,产出一串词,人类读了以为是真话,其实是被包装过的现实,甚至可能带有冒犯性。生成式 AI 并不聪明——至少就"智能"更完整的定义(包含批判性思维、创造性推理和情感智能)来说不是;它不是确定性的;它也不完全可靠,因为错误引用、错误内容、错误论断这类捏造,会和正确信息混在一起,用一套自信而有说服力的说法端给你。后续课程里我们会逐条讨论这些局限,看看能做些什么来缓解。

作业

去阅读更多关于生成式 AI的资料,试着找一个今天还没有 AI、但你可以加上 AI 的领域。跟"老办法"比,影响会有什么不同?你能做成以前做不成的事吗?还是能做得更快?写一份 300 字左右的总结,描述你梦想中的 AI 创业公司长什么样,可以用"问题""我会怎么用 AI""影响"这样的小标题,有商业计划书也可以附上。

如果你真做了这个作业,说不定可以去申请微软的孵化器 Microsoft for Startups Founders Hub,里面有 Azure 和 OpenAI 的额度、导师辅导等一堆资源,值得看看!

知识检查

关于大语言模型,下列哪种说法是对的?

  1. 每次得到的回答完全一样。
  2. 它把事情做得完美无缺,加减数字、写出能跑的代码都不在话下。
  3. 用同一个提示词,回答也可能不同。它很适合给你出一份初稿,文本代码都行,但结果还需要你自己改进。

答案:3。LLM 是非确定性的,回答会变化,不过你可以通过温度设置来控制变化的幅度。也别指望它把事情做完美,它的定位是替你把重活累活干掉,通常意味着你拿到一个不错的第一版,再逐步打磨。

做得好,继续上路

学完这一课,可以看看微软的 Generative AI 学习合集,让生成式 AI 的本事再上一个台阶!

下一课我们来讲怎么探索和比较不同类型的 LLM

这篇在讲什么,跟咱们的课怎么对?

资料库是大厂公开教材的中文译本,偏原理和工程做法。想看面向中小企业的白话版本,去入门课场景课