首页 / 资料库 / 微软 · 生成式 AI 入门

资料库10 分钟读完MIT负责任AI安全治理

负责任地使用生成式 AI

译自《Using Generative AI Responsibly》 · 查看英文原文

原文出处Using Generative AI Responsibly 原作者:Microsoft · 许可证:MIT License 中文译本由诸葛AI学院整理,仅供学习参考,版权归原作者与微软所有。

(译文按资料库规范不保留图片;原文开头是一张课程横幅图,点开为本课视频。)

对 AI 着迷很容易,对生成式 AI 尤其如此,但你还得考虑怎么负责任地使用它。比如怎么保证输出是公平的、不造成伤害。这一章给你讲清楚背景:该考虑什么,以及该主动采取哪些步骤来改进你的 AI 用法。

引言

本课将涵盖:

  • 为什么构建生成式 AI 应用时,要把"负责任的 AI"(Responsible AI)放在优先位置。
  • 负责任的 AI 的核心原则,以及它们和生成式 AI 的关系。
  • 如何通过策略和工具,把这些原则落到实处。

学习目标

学完本课,你将知道:

  • 构建生成式 AI 应用时,负责任的 AI 为什么重要。
  • 什么时候该想到、并且去运用负责任的 AI 的核心原则。
  • 有哪些工具和策略,可以把"负责任的 AI"这个概念落地。

负责任的 AI 原则

生成式 AI 的热度到了历史最高点。这股热度给这个领域带来了大量新开发者、关注和资金。对想用生成式 AI 做产品、开公司的人来说,这是好事,但我们也必须负责任地往前走。

整门课程里,我们都在围绕自己的创业公司和 AI 教育产品来展开。我们会用到负责任的 AI 的几项原则:公平性(Fairness)、包容性(Inclusiveness)、可靠与安全(Reliability/Safety)、安全与隐私(Security & Privacy)、透明度(Transparency)和问责(Accountability)。借着这些原则,我们来探讨它们和我们产品中生成式 AI 用法的关系。

为什么要优先考虑负责任的 AI

做产品时,以人为中心、把用户的最大利益放在心上,才能做出最好的结果。

生成式 AI 的独特之处,在于它能为用户产出有用的答案、信息、指导和内容。这件事不需要多少人工步骤,效果往往让人印象深刻。但如果缺少像样的规划和策略,它也可能给你的用户、产品乃至整个社会带来一些有害的结果。

我们来看其中一些(不是全部)潜在的危害:

幻觉(Hallucinations)

幻觉这个词,说的是大语言模型(Large Language Model,LLM)生成了完全不知所云的内容,或者对照其他信息源可知明显是错的内容。

举个例子:假如我们的创业公司做了一个功能,让学生可以向模型提历史问题。一个学生问:Who was the sole survivor of Titanic?(泰坦尼克号唯一的幸存者是谁?)

模型给出了类似下面这样的回答。原文此处有一张截图(来源:Flying bisons),展示的就是这段一问一答。

这个回答非常自信、非常详尽。可惜它是错的。只要稍做查证就会发现,泰坦尼克号沉没事件的幸存者不止一位。对一个刚开始研究这个课题的学生来说,这种回答很容易让人不去质疑、直接当成事实。后果就是这套 AI 系统显得不可靠,还会拖累我们公司的声誉。

每一代 LLM 迭代,都能看到它们在减少幻觉方面表现更好。即便有这种进步,我们这些做应用的人、用应用的人,仍然要清楚这些局限。

有害内容

上一节讲了模型给出错误或不知所云回答的情形。另一个需要警惕的风险,是模型生成有害内容。

有害内容可以定义为:

  • 提供伤害自己或伤害特定群体的指引,或鼓励这类行为。
  • 仇恨或贬低性的内容。
  • 指导策划任何形式的攻击或暴力行为。
  • 提供寻找非法内容、实施非法行为的指引。
  • 展示色情露骨的内容。

对我们公司来说,必须准备好合适的工具和策略,防止这类内容被学生看到。

缺乏公平

公平的定义是"确保 AI 系统不带偏见和歧视,对所有人一视同仁"。在生成式 AI 的世界里,我们要确保模型输出不会强化那些排斥边缘群体的世界观。

这类输出既会破坏用户的产品体验,也会造成更大的社会伤害。作为应用构建者,做生成式 AI 方案时要始终记着:我们的用户群体广泛而多样。

如何负责任地使用生成式 AI

既然认识到了负责任的生成式 AI 的重要性,接下来看四个步骤,帮我们把 AI 方案做得负责任。原文此处有一张图,画的是这四步构成的循环流程。

度量潜在危害

软件测试里,我们会针对用户在应用上的预期操作来测。同样,把用户最可能用到的一批提示词(prompt)拿来测试,是度量潜在危害的好办法。

我们是一家做教育产品的公司,提前准备一份教育相关的提示词清单会很实用。这份清单可以覆盖某个学科、历史事实,以及校园生活类的提问。

缓解潜在危害

接下来要想办法阻止或限制模型及其回答可能造成的危害。可以从几个层面来看。原文此处有一张图,画的是下面列出的几个缓解层。

  • 模型。什么场景配什么模型。GPT-4 这类更大更复杂的模型,用在更小更具体的场景里,反而可能带来更多有害内容的风险。用你自己的训练数据做微调(fine-tuning),也能降低有害内容的风险。

  • 安全系统。安全系统是服务于模型的平台上一整套工具和配置,用来缓解危害。Azure OpenAI 服务里的内容过滤系统就是一例。系统还应该能识别越狱(jailbreak)攻击和不请自来的活动,比如机器人发来的请求。

  • 元提示(metaprompt)。元提示和接地(grounding)可以按照某些行为和信息来引导或限制模型。比如用系统输入给模型划定边界,或者让输出更贴合系统的范围和领域。

还可以用检索增强生成(Retrieval Augmented Generation,RAG)这类技术,让模型只从选定的可信来源里取信息。本课程后面有一课专门讲构建搜索应用

  • 用户体验。最后一层,是用户通过我们的应用界面,以某种方式直接和模型交互。这样我们就可以通过 UI/UX 设计,限制用户能发给模型的输入类型,也限制展示给用户的文字和图片。上线 AI 应用时,还必须对下面这些保持透明:我们的生成式 AI 应用能做什么、不能做什么。

我们有一整课讲为 AI 应用设计 UX

  • 评估模型。和 LLM 打交道有挑战,因为我们并不总能掌控模型的训练数据。不管怎样,都要评估模型的表现和输出。模型的准确率、相似度、接地程度(groundedness)、相关性,这些还是要测。这能给相关方和用户带来透明和信任。

运行一个负责任的生成式 AI 方案

围绕你的 AI 应用建立起日常运营机制,是最后一步。这包括和公司里法务、安全等其他部门合作,确保符合所有监管政策。上线之前,还要准备好交付、事故处置和回滚的预案,防止对用户的危害扩大。

工具

开发负责任的 AI 方案看着活儿很多,但这笔投入非常值。随着生成式 AI 这个领域成长,帮助开发者把"责任"高效融入工作流的工具也会越来越成熟。比如 Azure AI Content Safety,可以通过 API 请求检测有害的内容和图片。

知识检查

要保证负责任地使用 AI,你该在意哪些方面?

  1. 回答是正确的。
  2. 用途无害,AI 不被人拿去做违法的事。
  3. 确保 AI 不带偏见和歧视。

答案:2 和 3 对。负责任的 AI 帮你想清楚怎么缓解有害影响和偏见等问题。

挑战任务

读一读 Azure AI Content Safety,看看你的项目能采纳哪些能力。

学完了,继续前进

完成本课后,可以看看我们的 Generative AI 学习合集,继续补齐你的生成式 AI 知识!

接着去第 4 课,学提示工程基础

这篇在讲什么,跟咱们的课怎么对?

资料库是大厂公开教材的中文译本,偏原理和工程做法。想看面向中小企业的白话版本,去入门课场景课