Smashing Magazine

Designing With Uncertainty: How AI Supercharges Probabilistic Thinking

8.5内容质量
Designing With Uncertainty: How AI Supercharges Probabilistic Thinking

TL;DR · AI 摘要

AI输出应被视为概率而非确定答案,设计师需培养概率思维以应对不确定性。

核心要点

  • AI的预测应被视为概率,而非确定性答案。
  • 概率设计思维有助于构建更适应复杂环境的产品。
  • 设计师应结合AI输出与人类判断,避免将AI预测当作政策执行。

结构提纲

按章节快速跳转。

  1. AI正在改变设计决策方式,但设计师需警惕将预测误认为确定性答案。

  2. AI输出基于数据模式,而非绝对答案,设计师应以概率视角解读。

  3. AI预测被误用为政策,导致用户与航空公司之间的法律纠纷。

  4. §概率设计的实践方法

    设计师应结合AI输出与人类判断,构建适应复杂环境的产品。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 概率设计与AI
    • AI输出的不确定性
      • 概率思维
      • AI预测 ≠ 确定答案
    • 案例分析
      • Air Canada事件
    • 设计实践
      • 结合AI与人类判断
      • 适应复杂环境

金句 / Highlights

值得收藏与分享的关键句。

#AI#UX#设计#概率思维
打开原文

在不确定性中设计:AI如何增强概率思维 — Smashing Magazine

  • 2026年6月16日
  • 0条评论

在不确定性中设计:AI如何增强概率思维

  • 19分钟阅读
  • AI , UX , 设计
  • 在Twitter上分享 , 在LinkedIn上分享

#### 关于作者

Pratik Joglekar 是 HubSpot 的高级产品设计师。他喜欢解决复杂和具有挑战性的用户体验问题。工作之余,他可以在……更多关于 Pratik 的信息 ↬

#### 电子邮件通讯

每周关于前端和用户体验的提示。受到182,000多人的信任。

  • 免费注册
  • 如何衡量用户体验和设计的影响,8小时视频 + 用户体验培训
  • 庆祝1000万开发者
  • Angular、React和Vue的自定义网络表单。你的后端。
  • 与Paul Boag一起的现代用户体验实践者
  • 现场用户体验培训 —— 与Vitaly Friedman一起的智能界面设计模式

在一个AI越来越多地影响设计选择的世界里,很容易将预测误认为是确定性。本文介绍了概率设计,这是一种让用户体验和产品团队接受不确定性、以细微差别解读AI输出并做出明智、适应性决策的思维方式。

2024年,一位Air Canada的客户向聊天机器人询问丧事票价。机器人自信地给了他一个并不存在的退款政策。航空公司拒绝接受该政策。一个法庭裁定客户胜诉。机器人并没有做出任何决定;它只是根据其训练数据中的模式预测了一个答案。公司却将该预测当作政策来对待。

这正是当今与AI设计相关的风险核心:概率系统被确定性界面所包装。AI提供一个猜测,界面将其呈现为事实,用户或组织则据此采取行动。

人类天生倾向于确定性思维。我们更倾向于相信过去的行为决定了未来的结果。抛硬币999次,每次都得到正面,确定性思维会认为硬币是被做手脚的。而概率思维则接受第1000次抛硬币仍可能得到正面或反面。第二种思维方式更难坚持,但正是设计师现在所需要的。

产品在复杂、非线性的环境中运行,而AI正在加速这种复杂性。当设计师和产品团队将AI的输出视为答案,而不是众多可能答案之一时,他们构建出脆弱的体验,而在某些情况下,如医学诊断或财务预测,甚至会带来真正的危险。

本文是一份实用指南,指导设计师如何与AI作为合作伙伴进行概率设计。它关注于使用AI来增强你的思维,而不是将其外包出去,同时在过程中考虑模型偏差、人类情感和感知风险。

概率思维 + AI

我们向AI提出的大多数问题不会产生二元答案。它们基于数据中的模式产生概率。如果你问“外星人存在吗?”,答案将介于合理和不确定之间。科学家认为宇宙中存在生命的可能性很大,但由于缺乏任何确凿证据,我们无法确认这一点。答案并没有解决这个问题,而是将其框架化为一种概率。

设计师应以同样的方式解读AI的输出。它们是信号,而不是结论,是需要在产品目标、用户行为和业务限制的背景下进行解释的可能结果。

许多数字产品已经以这种方式运作。Netflix 并不会因为您看了《办公室》就认为您会喜欢《超级商店》,而是根据概率进行估算,并据此展示相关标题。界面是根据预测做出响应的。

设计决策也可以遵循相同的逻辑。AI 模型可以将行为分析与研究洞察相结合,估算某些结果发生的可能性,这些概率可以作为设计策略的衡量标准。设想一种情况,分析显示用户完成购买的信心是 60% 与 90%。在 60% 的情况下,设计需要做更多的说服工作,用户评价、解释、比较和确认信号可能会帮助用户做出决定。在 90% 的情况下,用户已经受到激励,设计应开始减少摩擦,使操作能够迅速完成。同样的屏幕,却面临非常不同的设计问题。

注意:这是对这一想法的过度简化。请务必关注您产品的复杂细节。(大图预览)

在您确定方向之前,AI 还可以使用历史数据和行为模型来模拟结果。这些模拟的价值在很大程度上取决于提示的结构、它们定义的上下文、正在测试的假设、用户动机以及您希望强调的边缘情况。

我可以想到一个实际应用:通过结构化的提示来评估早期设计,尤其是在您无法直接接触到所设计用户群体的情况下。下面的提示是评估设计的起点,特别是从神经多样性用户的角度出发。将其视为一个模板,根据您的产品调整用户群体、标准和输出格式,并将其作为与团队讨论的开端,而不是最终结论。

从自闭症谱系障碍、注意力缺陷多动障碍(ADHD)、学习障碍等神经多样性用户的角度,评估[设计文件或网页链接]的可用性、可访问性和内容相关性。请考虑以下标准:布局和导航对神经多样性用户是否直观?语言和内容是否适合并吸引神经多样性用户?该群体在使用网站时可能会遇到哪些障碍(技术、认知或感官方面的障碍)?网站在多大程度上满足了神经多样性用户的具体需求或目标?请提供一个 SWOT 分析、神经多样性用户成功使用网站的概率评分,以及任何改进建议。注意:这是对这一想法的过度简化。请务必关注您产品的复杂细节,并进行适当的修改。

话虽如此,模拟并不能替代实验。因为模型是基于历史数据进行训练的,它们更强烈地反映了过去的行为,而不是预测未来的变化。想象一下,您正在为那些难以使用触摸屏的老年人设计语音界面。一个基于移动交互数据训练的模型可能会预测低参与度,这并不是因为这个想法没有价值,而是因为数据集反映了不同的用户行为。模拟应始终揭示假设,而不是阻碍创新。

使用 AI 时要谨慎对待有偏的概率思维

AI 系统是基于历史数据构建的,更具体地说,是基于它们所训练的数据集。这一基础决定了我们接收到的输出结果。在法国举行的 AI 峰会上,印度总理纳伦德拉·莫迪分享了一个很好的例子来说明这一点。如果你让一个 AI 模型生成一张左手写字的人的图像,输出结果可能仍然显示的是右手写字的人。原因在于统计学:大多数人是右撇子,而训练数据反映了这一点。虽然这一情况可能随着时间有所改善,但这一观点仍然具有相关性。在使用类似模型生成图像时,我偶尔仍会看到这种现象。

你所接收到的并不是真相。它是基于现有数据最可能的统计结果。始终要问自己,过去的数据是否能够有意义地预测未来的行为。如果额外的上下文可以提高预测的准确性,那就应该将其包含进去。没有上下文的情况下,输出结果只是众多可能答案中的一个,却被包装成唯一的答案。

(大图预览)

置信度评分同样需要受到审视。过度信任高置信度的输出会导致像加拿大航空那样的情况。忽视低置信度的输出可能会导致团队错过隐藏在嘈杂数据中的真实信号。一个置信度为 90% 的预测并不一定正确,一个置信度为 40% 的信号也不一定没有用处。设计师仍然需要权衡各种可能性,考虑当前的情况,并对 AI 的建议做出判断。

透明度是实现这一点的关键。随着 AI 系统越来越多地影响决策,人们需要了解输出是如何生成的、数据来源、推理过程以及推荐背后的总结。黑箱系统会滋生不信任。那些揭示其推理过程的系统则允许用户自行评估输出结果。这种透明度是优秀的设计和道德实践。它尊重人们对这些工具所寄托的信任。

以概率思维进行思考,通常意味着抵制快速答案的诱惑。AI 可以加速研究,比以往任何时候都更快地发现模式,但这些输出只是起点,而不是最终的决策。

用 AI 进行概率设计

设计决定了产品最终的体验方式——设计师做出的决策决定了体验是否令人满意、直观或卓越。设计本身固有地充满了假设和赌注。即使是最严谨的研究,也可能为同一个问题提供多个有效的解决方案,每个方案都有不同的成功概率。

以概率思维进行思考意味着认识到设计决策很少产生二元结果。它们会带来一系列可能的结果,而设计师的角色是导航这些可能性,并识别最有可能创造价值的路径。这种思维方式还增强了适应性:用户需求会演变,策略会改变,有时想法会失败。那些依赖数据信号、实验和学习循环的团队可以更快地找到最有效的解决方案。

在实际原则之前,有一个基本理念:

设计决策应优化于可能性,而非确定性。

为可能性设计,而非确定性

每一个设计决策都是一次赌注,而不是保证。即使决策是基于研究和数据做出的,它们仍然基于较小的样本和对用户在大规模使用时行为的假设。一个经过深入研究的想法在现实中仍可能失败。

加拿大航空公司的聊天机器人不仅在法律上具有重要意义,在设计上也提供了深刻的教训。这个机器人所做的,正是语言模型通常会做的事情:预测看似合理的文本。然而,界面却以完全自信的方式传达这些预测,没有任何保留意见,没有“这是我们通常的政策”,也没有明显的转接人工客服的路径。用户将这种自信解读为承诺,法律上,法庭也如此认为。

这就是当概率系统被包装成确定性界面时会发生的事情。界面将可能性转化为确定性,而风险正是从这里产生的。

为可能性而设计意味着让界面继续表现出不确定性,提供明显的转接人工支持的途径,并在内容为AI生成时进行清晰的标注,以防止出现不可预见的问题。

设计师应避免非此即彼的思维方式——一个好主意并不意味着一定会成功,一个熟悉的主意也不一定注定失败。相反,应关注变化、置信度和边缘情况。AI在此处可以发挥重要作用,作为一种组合思维引擎,它能够呈现不同的解释,突出风险,并生成结构化的建议。目标不是追求确定性,而是追求价值:它始终应以价值为导向。

回想一下《复仇者联盟:无限战争》中,奇异博士告诉钢铁侠,在无数可能的未来中,只有一种是他们能够获胜的未来。AI无法告诉你未来,但它可以帮助你探索可能的路径。与其询问一个想法是否会成功,不如让AI估计其可能性并给出一个评分,然后利用这些信号来指导决策。

将数据作为指南针,而非地图

即使是一个实际的概率,也不是最终的答案。想象一下,一个AI模型预测用户有80%的可能性更喜欢极简的结账体验。这并不意味着解决方案仅仅是“构建一个极简的结账流程”。数据应作为指南针,而不是地图。

  • 为什么模型会做出这样的预测?
  • 是哪些数据影响了它?
  • 它依赖于哪些假设?
  • 它实际检测到了哪些用户行为?

这些问题可以帮助设计师通过可用性测试和额外研究来验证预测。AI擅长识别模式,但很少解释这些模式为何存在。理解动机仍然是以人为中心的研究任务。

在这里,最明确的警示故事是亚马逊的实验性AI招聘工具,据报道,该公司在发现该模型学会了贬低女性简历后,最终放弃了这个项目。训练数据是大约十年的历史招聘决定,这些数据偏向于男性候选人,而模型继承了这种偏见。它开始对包含“女性”一词的简历进行惩罚,例如“女子国际象棋俱乐部队长”,并倾向于那些在男性简历中更常见的语言。系统本身并不是有意偏见的,偏见来自于数据。据报道,亚马逊曾试图调整该系统,但最终关闭了该项目,因为他们无法保证它不会产生其他歧视性模式。

像这样的例子说明了为什么批判性地解释AI的输出非常重要。设计师需要理解预测背后的数据,并评估他们所依赖的模型的可靠性。一个建议的价值取决于它所训练的数据,而唯一了解这些数据隐藏内容的方法就是去询问。

将实验作为学习系统

实验通常被描述为验证设计决策的一种方式。想要提高 CTA 的点击率?运行一个 A/B 测试。概率思维对此进行了重新定义。实验不仅应确认解决方案,还应减少不确定性。

  • 传统方法:测试功能以确认其成功性。
  • 概率方法:测试假设以减少不确定性。

传统的 A/B 测试成本很高。它需要耗费工程时间、流量分配和用户曝光,特别是当一个失败的变体与大量用户群体进行对比时。AI 模拟可以通过提高实验效率,在方案进入生产环境之前帮助筛选较弱的创意。用户需求不断变化,最有效的团队会快速迭代。

AI 可以通过基于历史和行为数据建模潜在结果,帮助早期评估假设。这些模拟充当假设过滤器,指出值得投入工程资源的方向。这也有助于实现个性化——不同用户可能对不同的体验有更好反应。版本 A 可能更符合高意图用户的偏好,而版本 B 可能更适合探索型用户。多个体验并行存在并不是缺陷,它们可以是一种有意的战略。

AI 通过揭示场景、分配可能性评分,并实现大规模个性化,放大了概率思维。实验变成一个持续的反馈循环:

预测 → 测试 → 学习 → 调整 → 重复!

让这个过程运作起来的几个步骤:

  • 改变思维方式:不要问:“这个功能会成功吗?”而是问:“我们在测试哪些假设?”使用这个模板来定义假设:我们认为 [行为假设] 会影响 [指标],因为 [原因]。当我们看到 [证据] 时,我们会知道我们是正确的。例如:我们认为将注册流程从 5 步简化为 3 步会提高完成率,因为当用户面对太多选择时,会经历决策疲劳。当我们看到至少有 15% 的步骤间转化率提升,同时激活率没有下降时,我们会知道我们是正确的。
  • AI 模拟:使用 AI 预测一些假设。之后,利用学习结果来识别最值得测试的假设候选。
  • 接受多版本:同时拥有两个活跃版本是完全没问题的。
  • 快速失败:奖励学习而非成功。将小型实验正常化,而不是一次进行大规模更改。因此,不要冒险进行一次大赌注,而是选择几个可能性并进行测试。
  • 可视化概率:创建一个概率表,列出每个变体的成功概率及其预测,以跟踪所有更改。

清晰传达不确定性

对设计师来说,最难的事情之一是让不确定性变得清晰且可操作。当不确定性被隐藏时,用户会将 AI 的输出当作事实。而当它被清晰传达时,信任会增加。

范围、估计和置信度指标能起到很大作用。“周五到周一”这样的交付时间窗口如实传达了变化性,而不会误导任何人,而一个具体的时间戳一旦错过,就会不断削弱信任。一个人脸识别功能如果问:“这看起来像 Pratik,对吗?”比仅仅用名字标注照片更诚实。

传达不确定性并不会削弱信任,反而会增强它。目标不是消除不确定性,而是聪明地设计以应对它。

不同用户对不确定性的反应各不相同,你的设计应考虑到这一点:

| 用户类型 | 风险 | 设计目标 | |------------------|--------------------------|------------------------------------------| | 过度信任的用户 | 他们行动过于迅速,轻易信任AI结果 | 更突出地展示不确定性 | | 不信任的用户 | 他们完全忽略AI | 展示历史准确性或置信度水平 | | 怀疑/平衡的用户 | 将AI作为指导,而非规则 | 加强AI辅助功能,并让他们决定如何呈现信息 |

保持人类在循环中

AI应增强人类的判断力,而不是取代它。最值得信赖的系统设计时会明确提供让人可以审查、质疑、纠正或覆盖机器建议的时刻。人类在循环中(HITL)不是一种安全网,而是一种优化引擎。每一次覆盖、纠正或拒绝都会成为高质量的反馈,从而随着时间的推移改进模型。

控制是被采纳的前提条件。当用户了解建议是如何生成的、可以评估其影响、并且可以轻松干预时,他们更愿意依赖AI。设计良好的产品会明确这一点:谁在行动,如果建议错误会发生什么,以及用户可以在哪里介入。

这些互动对于系统的改进也至关重要。每一次接受、拒绝或编辑都是一个强烈的信号,与被动分析相比,这种类型的反馈会产生更有意义的训练数据。它在实际使用和模型性能之间建立了闭环。

实践中的HITL是什么样子?

GitHub Copilot是一个很好的日常例子。它提供内联代码建议,开发者可以通过按Tab键接受、编辑或完全忽略这些建议。系统从不代表用户提交代码。作者权始终属于人类。每一个数据点都成为隐式反馈,说明哪些建议是有用的。Gmail的智能撰写功能也类似,它将预测的文本作为可选内容呈现,将语气和意图掌握在用户手中。

在高风险的情境中,HITL会更加明确。风险和欺诈系统通常使用概率评分来路由决策:低风险:自动进行;中风险:触发额外的验证;高风险:升级到人工审核。这在速度和判断之间取得了平衡,同时没有消除监督。

在医疗等安全关键领域,人类监督是不可协商的。AI可能会标记异常或提出诊断建议,但临床医生保留最终决定权。解释细节的工具可以帮助从业者理解为何做出某项建议,从而增强信心而不削弱责任。

为人类判断进行设计

从用户体验的角度来看,HITL是将交互模式与风险等级相匹配。简单的接受/拒绝操作适用于低风险建议,这些建议可以提高速度而不会产生实际后果。随着风险的增加,影响数据、金钱或人员时,预览和批准步骤变得至关重要。解释可以帮助用户校准信任,而不是盲目接受输出。

幕后发生的事情同样重要。系统应记录用户决策时的上下文,将其输入学习工作流程,并记录覆盖操作以供审计。随着时间的推移,团队可以跟踪诸如覆盖率、置信度准确性、批准时间以及感知信任等信号。高覆盖率并不是用户失败的标志,而是设计或模型需要关注的信号。

实现不佳的 HITL 系统可能会以微妙的方式失败。人工审核可能会退化为一种形式上的批准。工作流程可能会变得如此缓慢,以至于用户绕开安全措施。反馈可能会偏向于一小部分用户。这些风险是真实存在的,但它们是设计问题,而不是移除 HITL 的理由。

目标不是最大化人类参与度,而是将参与度集中在不确定性、影响或伦理要求的地方。保留 HITL 更多的是关于清晰度,而不是控制:清晰地知道谁做决定、在何种不确定性下做出决定,以及人与机器之间如何分担责任。

优化韧性,而不仅仅是转化率

优秀的设计会随着环境的变化而适应。特别是在 AI 驱动的系统中,产品设计不能再仅仅为了短期转化率指标而优化。用户意图是流动的,环境变化迅速,概率系统也在不断演变。今天有效的方法,明天可能会悄然失效。设计韧性意味着构建即使在假设、数据和用户行为发生变化时,依然可靠、值得信赖且有用的产品。

韧性设计将问题从:

“我们现在如何最大化这个指标?!” → “这个系统在时间推移、压力和不确定性下会如何表现?”

一个具有韧性的系统是:

  • 随着新数据和行为的出现而适应。
  • 安全地失败,而不是灾难性地失败。
  • 保持透明和可解释性。
  • 避免脆弱且过度优化的交互模式。
  • 预见二阶效应和未预期的影响。

不要只考虑上个季度的数字。也要关注接下来几个季度的变化,及时识别并做出相应的调整。

构建能随着概率变化而适应的系统

概率不断变化,AI 模型发生偏移,上下文演变,用户需求也逐渐成熟,因此假设条件稳定的设计在概率环境中会带来脆弱性。一种具有韧性的方法将波动视为默认状态。

想想推荐系统是如何演变的。内容流的早期版本优化了参与度,一段时间内参与度确实上升了。但随后用户开始注意到内容流变得狭窄、重复,甚至令人疲惫。具有韧性的系统会重新平衡,引入新颖性,多样化信号,并结合长期满意度指标,而不仅仅依赖短期点击。

设计师应创建能够预期变化的界面,支持动态重新排序、上下文解释以及从陈旧个性化循环中退出的机制,所有这些都有助于系统在概率变化时保持其实用性。

优化长期结果,而不仅仅是短期胜利

短期的转化收益往往隐藏着长期的成本。加快入职流程可能会降低理解能力。最大化通知点击率可能会削弱信任。单独优化参与度可能会导致不健康的使用模式。脆弱的系统只关注数字的最大化,而忽视了那些几周或几个月后才显现的下游后果。

Duolingo 的“心”系统是设计时考虑这一问题的一个好例子。它引入了摩擦:如果你犯了太多错误,你的心就会用完,然后必须等待或练习旧内容才能获得更多的心。从纸面上看,这似乎会降低转化率:每节课的数量减少。但实际上,团队公开讨论过它如何支持长期的动机和知识保留,而这才是学习类应用真正重要的指标。短期参与度可能会下降,但长期结果会得到改善。

Meta 也进行了类似的转变,尽管更加犹豫。该公司公开承认,单纯优化“使用时间”会产生意想不到的情感和社会影响,这促使他们明确转向“有意义的社交互动”作为指导性指标。这种转变是否完全落实还有待商榷,但承认这一点本身就已经很重要:在大规模优化错误的事物会带来真正的后续成本。

因此,设计师必须经常问自己以下问题:

  • 我们无意中强化了哪些行为?
  • 如果在大规模重复中,这种交互是否仍然健康?
  • 我们是在优化生态系统整体的健康,还是仅仅为了下一个点击?

以应对不确定性的方式来规划,就像你规划应对规模增长一样

团队通常会为流量高峰做规划,但很少为不确定性高峰做准备。然而,AI 系统会退化,对抗性行为会演变,外部冲击可能在一夜之间改变用户行为。具有韧性的设计假设存在变数,并为此做好准备。

这意味着要设计应对信心下降的情况。当 AI 不确定时,你的界面会怎么做?它是安静地失败,还是优雅地交接?如果 AI 协助完全消失,体验是否仍然有意义?一个好的后备策略与正常流程一样重要。

一些实际的行动建议:

  • 设计应对信心下降的情况。展示后备状态,允许手动覆盖,并在关键位置可视化不确定性。
  • 测量长期用户健康状况。跟踪满意度、留存质量以及非预期行为,而不仅仅是转化率。
  • 构建适应性。使用可调整的排名规则、动态状态,并在不同用户群体中进行持续的实验。
  • 早期建模二阶效应。每一个优化都会产生阴影;在发布前将其展现出来。
  • 在发布前使用韧性检查清单。在 AI 信心低时系统如何表现?安全的后备方案是什么?我们预计会有哪些偏差?

结论

如果你从这篇文章中只带走一个观点带到下一次设计评审中,让它成为这个:

停止问“这会起作用吗?”,开始问“这有多大可能起作用,以及当它不起作用时会发生什么?”

这种单一的重新定位将改变你撰写假设、解读 AI 输出、规划实验以及设计系统出错时应对方式的方式。从本周开始,为每一个你接受的 AI 推荐命名背后的假设,找到产品中一处将概率性输出当作确定性呈现的地方,修正其表述,并在正常流程之前设计好后备方案。

从确定性设计转向概率性设计,与其说是引入了新工具,不如说是采取了一种新的态度。人工智能并没有将不确定性带入我们的世界,它只是让原本就存在的不确定性变得无法忽视。人工智能可以进行估算、模拟和推荐,但它无法决定什么才是重要的,哪些用户被忽视了,或者哪些非传统的想法值得去捍卫,而不是仅仅依赖于昨天数据训练出的模型。这些仍然是人类的责任。思考时应以范围而非单个点为中心,测试假设而非功能特性,构建适应性而非完美性。在一个预测成本低廉、判断却罕见的世界里,设计师最宝贵的贡献就是不断问自己:还有什么可能是真的?

(yk)

了解更多:

Smashing Newsletter 每周发送前端与用户体验的实用技巧到你的邮箱。

前端与用户体验在线研讨会,包含实用收获、现场课程、视频录像和友好的问答环节。

TypeScript 50 课:全面讲解 TypeScript,包含代码讲解和示例。还有其他印刷书籍。