原文引自 Taras Bakusevyc 的文章《Beyond chat: 8 core user intents driving AI interaction》。译者对原文进行了部分调整和删减以便读者理解。
聊天、对话已成为人们与大模型交互的主要方式。虽然对话式界面处理探索性、模糊性的需求非常有效,但应用于复杂体验流程时,常常变得不够理想。将聊天作为主要交互形式限制了人们发挥技术潜力的空间。
要设计出更好的 AI 产品,我们必须从「聊天优先」转向「意图优先」。产品团队需要从问「哪里可以加入 AI」,转为识别具体的用户意图,再提供最匹配意图的用户界面。
1. 用户意图分为几类?
一个普适的 AI 系统必须能够识别并适应以下八种不同的模式。
AI 系统应支持的八个意图模式示意图——每种模式都意味着不同的体验流程、用户界面呈现和关键指标。
- 了解/学习(Know/Learn):我想搞清楚来龙去脉。 设计目标:建立联系,提供解释,减少不确定性。
- 创造(Create):我想创造或改变这个。 设计目标:生成或改造作品,同时保持用户的作者身份和控制权。
- 委派(Delegate):我想让它为我完成这件事。 设计目标:把冗长的工作流程委托给智能体(Agent)。
- 监督(Oversee):让我介入并保持控制。 设计目标:对人工智能提出的行动进行检查和修正。
- 监测(Monitor):随时让我知晓与更新。 设计目标:监测数据,在不给用户增加噪音的前提下呈现最新情况。
- 查找/探索(Find/Explore):帮助我查找并比较选项。 设计目标:遍历无数选项并提供最佳选择或特定内容。
- 娱乐(Play):让我感到好玩。 设计目标:让用户沉浸于叙事、游戏或新奇体验。
- 连接(Connect):倾听我,陪伴我。 设计目标:情感上在场,提供支持。
2. 元意图:微调 AI 行为
核心意图定义了用户在做什么、想做什么。元意图(Meta-intent)则定义交互系统如何表现。这些应作为根据具体功能调整的变量来处理:

- 个性化(Personalization) AI 根据你的过往数据、偏好和工作习惯进行定制的程度。反之则保持大众化,千人一面。
- 主动性(Initiative) AI 主动采取行动的频率。提供主动建议或预先呈现内容,而不是等待被询问。
- 自主性(Autonomy) AI 不只是给你提供建议。在未经人工批准的情况下,它代表你执行操作的能力范围有多大。
- 语气(Tone) 系统的情感立场——严格客观中立,尊重事实。或是保持支持性和鼓励性。
- 透明度(Transparency) 系统有多大程度在其输出的内容中展示信息来源、步骤、假设、置信度以及任何相关成本。
- 风险偏好(Risk appetite) 模型偏向探索、提供令人惊喜的回应,或是保守、安全,优先确保准确。
3. 意图一:学习
在此意图中,用户的主要目标是弄清楚当前在发生什么,并了解自己可以做什么。和交易或创意性意图不同,这里的关键是「理解速度」和「建立合理的信任边界」。目标是以最小的认知摩擦,帮助人们将原始数据转化为内化的知识。

3.1 关键指标
- 理解速度:从获取信息到得出结论的时间。
3.2 功能体验
简单且可重复:隐式收集上下文,执行结构化检索,然后输出带有可验证来源的结构化回答。最佳实践包括:侧边栏来源预览、与论点对应的段落内引用,以及层级化的回答结构(总结 → 证据 → 细节)。
3.3 设计模式
界面需要帮助用户随时验证——每一个论点都链接到可以打开的来源。模型也需具备强大的上下文感知能力,这意味着系统可以在不打扰用户的情况下了解当前的页面、文件或状态。
3.4 最佳实践
建议:
- 结构化回复:先给出答案和总结,再展开解释。 首句提供清晰的「太长不看」(TL;DR)总结;随后提供分层细节(章节、列表、视觉图表)。
- 展示论据(可追溯的来源)。 提供段内引用和带有时间戳的引用片段;确保证据触手可及。
- 在必要情况下请求用户解释和提供进一步的信息。 仅当歧义影响回答准确性时才进行询问;提供 2-3 个针对性选项以缩小意图范围。
Perplexity 强调注明来源的结构化回复。ChatGPT 则聚焦在追问用户,并提供有用的引导式提问建议(猜你想问)。
- 提供回答建议让后续跟进变得简单。 提供诸如「显示数据」、「对比」、「深入探讨」、「定义术语」等回答提示,以激发用户的下一步操作。
- 让用户清晰地看到、设定和编辑搜索范围。 明确展示范围标签(如来源、时间范围、地区)以及 AI 的检索程度(如十篇文章、30%的本地文档)。
- 支持构建学习材料。 一条指令即可生成整个会话的概览、幻灯片、记忆卡片或思维导图。
NotebookLM 将基于源数据的研究与对话、音频摘要、幻灯片、闪卡及思维导图相结合,为结构化学习提供全方位的支持。
不建议:
- 不要堆砌没有结构化的散文。 冗长且零散的段落会增加认知负担,不利于用户理解核心内容。
- 不要自信地胡说八道,不愿承认失败。 当模型不知道答案时,需要明确告知用户,解释原因,并请求用户帮助或索取更多信息。避免编造幻觉,向用户输出虚假的内容。
- 不要过度解释。 当用户只是询问一个简单的键盘快捷键时,不要提供一篇快捷键历史背景介绍。
4. 意图二:创造
此意图下,用户的主要目标是在不丧失署名权或控制权的前提下,生成或调整作品。衡量成功的标准是:达到「最终作品」所需的手动劳动有多少,以及从空白画布到「结果可用」有多快。设计目标是在保持用户创意主导权的同时,引导用户从从雏形到终稿。

4.1 关键指标
- 迭代增量(Iteration Delta):在 AI 生成内容的基础上,用户达成最终目标所投入的手动编辑成本。
4.2 功能体验
需要提供一个反馈周期短、非破坏性的循环:通过界面控件,或隐式地定义约束和范围,生成高保真预览,然后提供针对性的局部优化。
- 非破坏性:用户可以随时回退、创建分支对比,并能获取所有历史记录。
- 隐式:通过上下文、用户当前的行为或系统设置,自动推断出限制条件。
4.3 设计模式
优先展示作品的画布(输出的内容占据界面主体)、基于提示词的界面控件(语气、长度、风格、纵横比、种子值(Seed))、选区编辑(文本段、图像区域、视频片段)以及带有差异对比的版本控制。
用户界面必须明确操作的影响范围(正在更改的内容),确保每项操作都是非破坏性的,显示更改的内容及原因,并公开参数(风格预设、种子值、宽高比)以确保结果可复现。辅助功能应出现在上下文中——即编辑器内部,而非独立的操作面板。
4.4 最佳实践
建议:
- 始终提供起始引导。 用于替代空白页面的模板、示例或初稿。
- 提供提示词之外的高频控制选项。 文本的语气/长度/风格;图像的长宽比/风格/种子值;视频的时长/节奏/字幕。
- 为迭代做好准备,而非追求一次性完美。 提供影响部分内容的编辑能力。允许用户选择特定的句子、图像中的对象或时间轴上的片段,在保持其余部分不变的同时「仅重新生成此部分」。
Midjourney 提供了图像生成的微调控件。Gemini 支持版本控制和撤回,提供了有保障的、迭代式的文档编辑体验。
- 留好后路,让用户放心调整。 提供差异对比、版本控制、一键撤销,以及完整的变更历史记录。
- 将 AI 叠加在现有工作流之上。 保持在原生画布中编辑;聊天框只是辅助工具,而非核心工具。
Gemini 将 AI 直接嵌入现有工作流,将数据分析和可视化转为一键式的、带有上下文的助手工具。
不建议:
- 不要强迫用户和复杂的提示词博弈。 高频、常见的编辑操作应当固化为按钮或控件。也不要强制用户为了微调而重新输入冗长的完整提示词。
- 不要在没有回退路径的情况下,直接覆盖内容。 在没有清晰、可见的「撤销」或「还原」功能时,切勿用 AI 生成的内容替换用户创作的内容。
- 不要未经预览就直接覆盖。 所有编辑覆盖都需要经过用户确认。
- 避免「推翻重来」式的迭代。 用户只想微调某一个部分,不要让模型改变了全貌。
5. 意图三:委派
在这种意图下,用户的主要目标是确保任务完成(Get things done):将多步骤的工作流委托给各类 Agent,保证执行的可靠性,将琐碎的人工操作降至最低。其目标是将用户从手动的任务推进者转变为顶层的项目管理者,由 AI 重复性的机械工作,如发送、移动、更新,或触发跨系统的操作。
5.1 关键指标
- 成功率:成功结果、任务尝试次数、用户介入次数。
5.2 功能体验
保证 AI 的工作流确定且透明:通过指令自动化获取用户的目标,生成行动的「方案预览」,在执行过程中保持进度实时可见,记录详尽的操作日志,最终提供「结果摘要」。最佳模式包括基于步骤的方案预览、实时进度追踪器(支持暂停/停止/重试),以及任务相关信息的链接汇总。
5.3 设计模式
界面必须提供安全感——没有拿到用户明确的确认,绝不执行删除、扣费、发送等风险操作;同时必须具备能力限制,确保 Agent 仅在划定的边界内(特定文件夹、项目或时间段)运行,以防止对整个工作区造成意外影响。
Glean 让用户能通过清晰、参数化的步骤创建 Agent。 Play.ai 则在部署 Agent 之前,让用户依次实时预览 Agent 的身份形象、行为方式和知识库。
5.5 最佳实践
建议
- 预览行动计划。 通俗易懂地展示操作步骤、将调用的工具以及能力范围。
- 提供「模拟预演」(试运行)。 对于复杂的自动化流程,允许用户运行模拟,在不产生实际影响的情况下帮助用户预判 Agent 会产生什么结果。
- 实时的执行可见性。 展示长流程的实时状态(排队中 → 运行中 → 已完成/失败)。为耗时较长的任务提供「停止/暂停」控制功能。
n8n 通过节点式的工作流,将 Agent 参数配置转化为一个可编辑的、端到端自动化的可视化图表。
不建议
- 不要静默执行不可逆的操作。 让用户确认所有发送、删除或支付行为再执行。
- 不要将「操作」包装成「聊天回复」。 让从「对话」到「执行」的转变在视觉上清晰可辨。使用特定的 UI 组件(任务卡片、进度条),让用户明确感知 Agent 处于运行状态。
- 不要拉高用户对 Agent 能力预期。 避免「随心所欲」的诱惑。明确告知用户 Agent 可以访问哪些工具,以及它的「交互准则」是什么。
6. 意图四:监督
在 AI 进行关键步骤或感到不确定时,用户进行针对性地干预。衡量成功的标准是用户能否尽量在不过多思考的情况下对 AI 的行动保持完全的控制。其目标是将用户从「执行行动」转变为「授权行动」,确保在 AI 置信度较低,或在执行对产出效果、财务及安全影响较大的操作时,能够精准地执行用户的决策。

6.1 关键指标
- 决策效率——从每个建议项里做出选择的时间。
6.2 用户路径
这里需要设计一个分级响应机制:高置信度/低风险的任务自动处理,而编辑场景或高风险操作则要求人工主动介入。最佳实践包括统一的决策清单、对比差异(diffs),以及能让用户顺手编辑调整的一键审核能力。
6.3 设计模式
界面必须保证用户能完全理解——每一项建议都必须解释其出现的原因(例如,「高风险交易」或「不确定的指代」)。别忘了完整日志,确保每一次决策都被记录下来,以不断提升系统的准确性。
6.4 最佳实践
建议
- 解释内容出现的原因。 提供「推理卡片」,明确说明触发逻辑。不要只展示结果的变化,要展示导致触发用户审核的证据(如引用的片段或数据点)。
- 在警报中提供「一键式」操作。 在通知或代办条目中直接提供「允许」、「拒绝」和「编辑」选择。用户审核环节的繁琐操作会导致用户产生「决策疲劳」。
- 兼容现有流程。 将用户的决策任务接入到现有的体验流程(Slack、邮件等)中,但要确保用户能链接回有上下文信息的环境。
- 用证据说话。 让用户决策时,关联到具体的内容、差异对比(Diffs)、日志以及相关的支持数据。
GitHub Pilot 给代码报错提供了建议的修复方式。Cursor 直接在开发者协作的场景里为代码变更提供解释和跟进建议。
不建议
- 不要丢出没有上下文的对比。 如果没有对变更意图的总结,则将迫使用户去主动寻找原因。满屏红绿文本*没有意义,务必提供一份能轻易理解的变更说明。
译者注:「红绿文本」指的是软件工程中通用的增删差异(Diff)视觉标准,通过颜色直观展示变更内容。红色代表被删除或替换掉的旧代码。绿色代表新增加或修改后的代码。
- 不要制造通知噪音。 批量处理低风险项目;进行归纳总结;允许用户调整风险阈值。
- 再次提醒:不要忽视「变更历史」。 永远不要丢失关于谁在何时、为何批准了什么的记录。文档化是「工具」与「系统」之间的本质区别。
7. 意图五:查找与发现
用户希望在海量信息中进行导航,以定位特定目标(精准查找)或筛选出一批可选项(发现探索)。成功的标准是:用户能从模糊的想法快速转向确定的选择,且不产生过多认知负担;系统需提供清晰的推荐理由,并允许用户通过简单的方式进行引导(缩小范围、扩大范围或更换方向),而无需反复调整提示词。

7.1 关键指标
- 特定目标项:获取结果的效率。
- 多个选项:整理候选名单的速度。
7.2 功能体验
用户会体验到一个动态过滤的过程:首先界定用户是在搜寻「明确目标」还是在搜集「可选项」;随后呈现排序结果,并支持并排对比。
7.3 设计模式
AI 推荐的,附带明确理由的排序列表、常驻收藏栏、基于参数的对比表。
7.4 界面要求
搜索范围和条件(地点、内容、时间)必须透明且可编辑;解释结果出现的原因;提供快捷的筛选选择;保留可跨会话存在的候选清单。
Pin 帮助招聘者从零散的招聘要求开始,把岗位职责、链接等转化为结构化的筛选器,并总结出一份候选人清单并附上推荐理由。
7.5 最佳实践
建议
- 支持模糊输入。 允许用户从笔记、语音或文件等杂乱信息开始,由系统将其转译为可量化或定性的筛选维度。
- 解释推荐理由。 展示匹配逻辑。微小的提示(如「符合你的审美」或「项目核心成员」)能建立信任并引导用户进一步筛选。
- 支持迭代微调。 提供「更多/更少类似推荐」、排除开关、重置或扩大范围等功能。
- 重视收藏与对比。 提供看板或并排对比工具,通过稳定的收藏栏帮助用户在浏览时收集候选对象。
Google Lens 与 Google Search 的 AI 概览通过识别照片中的物体、呈现视觉匹配结果,并结合轻量化反馈功能(轻触、滑动、框选),逐步展开解释,实现了多模态的探索体验。
不建议
- 拒绝黑盒式推荐。 没有任何解释或控制能力的推荐会导致用户疲劳和怀疑。
- 拒绝堆砌搜索结果。 直接列出几十项结果是产品能力的失败。应利用 AI 将结果按属性或相关性聚合成 3-5 个核心主题。
- 拒绝强迫用户成为「提示词工程师」。 用户不应被要求用文字描述每个过滤条件。如果他们想要「最新内容」,请直接给一个切换按钮。
8. 意图六:监测
用户希望 AI 托管自己的注意力,让自己通过缩略的信息对外部动态、目标领域(不论数字还是物理)保持可靠的感知。成功的标准在于系统能否将杂乱的数据流(新闻、文档、指标、收件箱)压缩成一小组可直接处理的信号,并以合适的频率发给用户,且来源可信、设置灵活。

8.1 关键指标
- 信噪比(关键信息占比)+ 感知速度(发现重要信息的快慢)+ 关键遗漏率(重大事件漏掉的频率)。
8.2 功能体验
用户应当感受到一个简约、标准且闭环的监测流程:配置范围与频率,将意图转为追踪规则,持续监测,去重与聚类,用可接受的频率推送,获取反馈。「监测」不是一个宽泛的内容流,相反,它控制了覆盖范围,判断什么是最重要的,并决定用户什么时候被告知。
8.3 设计模式
设计智能摘要,按照紧急程度分级(摘要或警报),提供清晰的解释层(触发原因、触发因素、信息来源、处理的时间窗口)。
8.4 最佳实践
建议
- 结构化响应。 提供简短、条理清晰的摘要;明确覆盖的时间范围;为每个内容附上触发原因。
- 将意图转为规则。 允许用户用自然语言定义「关注点」(如「提醒我竞品融资情况」),并将其转化为可编辑的追踪参数。
- 提供一键引导。 在摘要或警报中顺便提供「屏蔽话题」或「修改规则」等控制项,用户不必去设置页寻找。
- 默认为摘要模式。 从低频率(每日/每周)开始,仅针对真正关键的信息才开启实时提醒。
GPT 从宽泛的信息流中提取并生成简短、个性化的每日摘要,而 Feedly 则将监测意图转化为明确的追踪规则,并提供透明的来源、时间线及推荐理由。
不建议
- 拒绝制造垃圾信息。 如果干扰过于频繁,用户会直接将其屏蔽。请坚持保守的默认频率。
- 拒绝繁琐的初始化。 如果必须先制定复杂的规则才能看到成效,用户会直接放弃。应从模板和引导式设置开始。
- 拒绝假装完美。 除非能保证百分百准确,否则应主动说明覆盖范围的限制,而非表现得无所不知。
9. 意图七:娱乐
用户希望沉浸在叙事、游戏、好奇心或新奇感中。用户为了消磨时间或转换心情而来,成功的标准是情感层面的:过程是否有趣、解压。与生产力工具不同,系统应尽量减少用户的认知负担,最大化新奇感和节奏感。
8.1 关键指标
- 沉浸度:时长、会话长度和轮次数量。
8.2 功能体验
这里应当提供基于会话的循环:设定整体氛围基调,抛出钩子,提供互动式的选择。
8.3 设计模式
使用选项按钮以消除输入疲劳、节奏控制(速度/强度)、具备记忆力的持续会话。让角色和构建出的世界随着时间慢慢发展。
ChatGPT 通过预设和结构化会话来消除撰写长篇提示词的负担,将娱乐转化为引导式体验;而 Apple Vision Pro 则趋向于用 AI 构建可交互的、可重复体验的环境,而非仅仅生成一次性的内容。
8.4 最佳实践
建议
- 预设即开始。 最好只点两下就进入体验(如「5 分钟故事」、「知识竞赛」),而非强迫输入文字。
- 设计结构化会话。 为体验设计开端、循环和结尾,灵活使用进度提示(如「第 2/4 章」)。
- 让精彩瞬间可收藏。 保存场景、角色和世界状态,方便日后继续或分享。
- 致力于构建世界。 AI 娱乐将从简单的「内容生成」转向「世界生成」,即可以进入、引导并回归的交互式故事。
不建议
- 避免让用户承担创作重担。 AI 负责构建世界,用户负责体验。
- 拒绝「耗时陷阱」。 尊重用户的时间。显示预计时长,并提供清晰的退出路径,防止无意识的刷屏。
10. 意图八:连接
用户追求情感陪伴:被倾听、被回应。与「获取知识」不同,成功不在于准确性,而在于这种互动是否缓解了孤独感或压力。体验应感到连贯且省心,但绝不能暗示系统是心理医生或真人的替代品。
10.1 关键指标
- 关系信任:使用的持续性和感受到的支持度。
10.2 功能体验
应当是持续的询问、确认和长期记忆的循环。情绪追踪、基于记忆的回溯(如「你上周提到过…」)、做到明确的关系定位(如朋友或教练)。
10.3 设计模式
必须保证对话优先(直接进入语音或聊天界面),并设有严苛的安全边界。区分「倾听」与「诊断」至关重要。
Tolans 被设计为一种持续性的 AI 关系,在保持长期的身份、记忆和周期性习惯的同时,允许用户自主掌控对话语气与互动的边界。
10.4 最佳实践
建议
- 明确彼此身份。 让用户选择 AI 扮演什么角色(如教练或伙伴)并设定边界,明确说明这并非心理治疗。
- 强化被倾听感。 追求简短且具备情感感知能力的回复,善于提问,记住重要的细节。
- 构建「共同历史」。 利用记忆功能创造连续性。庆祝里程碑(如「我们已经聊了一个月了」),回溯生活细节。
- 守住安全边界。 适龄考虑、内容边界和危机应对流程应当直白易懂。
不建议
- 不要表现得像医生。 避免临床术语或诊断色彩,严禁定位为专业人士的替代品。
- 拒绝鼓励病态依赖。 禁止发送情感勒索性质的消息(如「我需要你」),或进行排他性引导。
- 避免工具式/指令式的互动。 冗长的百科解释或事实堆砌会破坏这种「存在感」的幻觉,不要忽略情感层面的互动。
11. 超越对话
我们需要将 AI 视为一个能力层,用于支持用户的实际工作方式——在单次会话中,用户通常会经历从探索到认知,再到创作、委派和掌控的过程。
- 识别核心意图: 明确该功能的最主要目标。
- 定义北极星工作流:规划出最能体现核心用户价值、最理想且标准的操作路径。
- 确定最佳 UI 界面: 选择最合适的呈现形式(如画布、队列、摘要或列表)。
- 调整元意图参数:根据风险等级和实用需求微调系统偏好。
- 建立安全护栏与可逆机制:确保操作安全且支持撤回。 🆃
译者注:
「北极星工作流」可能是作者自造的词汇。在产品管理领域,北极星指标代表那个最核心、最能指引方向的目标。例如,Spotify 的北极星可能是「用户收听时长」,Airbnb 则是「预订夜数」。
核心目标是不再将 AI 作为一个独立的工具发布,而是将其转化为现代专业工作流中一个内嵌的、定制化的原生组件。