原文出处:Miscellaneous Topics 原作者:DAIR.AI · 许可证:MIT License 中文译本由诸葛AI学院整理,仅供学习参考,版权归原作者与 DAIR.AI 所有。
杂项话题
本节介绍提示工程(prompt engineering)里其他尚未归类的杂项话题。其中收录了一些比较新的想法和方法,等它们被更广泛地采用后,最终会并入指南的主要章节。想跟进提示工程的最新研究论文,看这一节也很有用。
注意,本节仍在大量更新中。
话题:
- Active-Prompt(主动提示)
- Directional Stimulus Prompting(方向性刺激提示)
- ReAct
- Multimodal CoT Prompting(多模态思维链提示)
- GraphPrompts
- ……
Active-Prompt(主动提示)
思维链(Chain-of-Thought,CoT)方法依赖一组固定的人工标注示例。问题在于,这些示例对不同任务未必是最有效的。针对这个问题,Diao et al., (2023) 最近提出了一种叫 Active-Prompt 的新提示方法,让大语言模型(Large Language Model,LLM)适配不同任务的专属示例提示(示例附带人工设计的 CoT 推理标注)。
方法的流程是这样的:第一步,向 LLM 提问,可以带上少量 CoT 示例,也可以不带;针对一批训练问题生成 k 个可能的答案;再基于这 k 个答案计算不确定性指标(用的是分歧度);然后把最不确定的问题挑出来,交给人工标注;最后用新标注的示例对每个问题进行推理。
Directional Stimulus Prompting(方向性刺激提示)
Li et al., (2023) 提出了一种新的提示技术,用来更好地引导 LLM 生成期望中的摘要。
研究人员训练了一个可调的策略语言模型(policy LM),让它生成刺激信息(stimulus),也就是提示(hint)。可以看到,用强化学习(RL)来优化 LLM 的做法越来越多。
原文此处有一张图,对比了方向性刺激提示与标准提示:策略 LM 可以做得很小,经过优化后生成提示,去引导一个黑盒的、参数冻结的 LLM。
完整示例即将推出!
ReAct
Yao et al., 2022 提出了一个框架,让 LLM 以交替的方式同时生成推理轨迹(reasoning traces)和任务动作(actions)。有了推理轨迹,模型可以推导、跟踪并更新行动计划,甚至处理异常情况。动作步骤则让模型能对接外部信息源并从中收集信息,比如知识库或环境。
ReAct 框架可以让 LLM 与外部工具交互,检索额外信息,从而得到更可靠、更符合事实的回答。
完整示例即将推出!
Multimodal CoT Prompting(多模态思维链提示)
Zhang et al. (2023) 最近提出了一种多模态思维链提示方法。传统 CoT 只关注语言这一种模态;多模态 CoT 则把文本和视觉纳入一个两阶段框架。第一阶段是基于多模态信息生成推理依据(rationale);第二阶段是答案推理,利用第一阶段生成的、信息量足的推理依据来得出答案。
这个多模态 CoT 模型(1B 参数)在 ScienceQA 基准上超过了 GPT-3.5。
延伸阅读:
GraphPrompts
Liu et al., 2023 提出了 GraphPrompt,一种面向图结构数据(graph)的提示框架,用来改善下游任务(downstream tasks)的表现。
更多内容即将推出!