群体隐私如果对单个实体保证了差分隐私它自然能为群体提供稍弱的隐私保护。后处理不变性对差分隐私的输出进行任何后处理都不会影响其差分隐私的保证。透明度与问责制我们探讨了公平和隐私的数学保障现在来看看如何让AI的决策过程变得可理解即透明度和问责制。这指的是关于AI系统如何工作、如何做出决策以及如何开发和部署的开放性和清晰度。案例研究透明度在以下场景中至关重要银行贷款银行使用AI系统评估贷款申请。缺乏关于决策如何做出的透明度可能导致不信任和关于不公平的指控。透明度意味着解释影响批准或拒绝决定的因素。刑事司法一些司法管辖区使用AI评估被告的再犯风险。这些系统因不透明和潜在偏见而受到批评。使AI评估透明化对于确保公平、接受审查至关重要。自动驾驶汽车自动驾驶汽车在复杂环境中做出瞬间决策。当事故发生时理解其决策过程对于公共安全、监管批准和系统可靠性改进至关重要。可解释性技术为了实现透明度研究人员开发了多种模型可解释性技术LIME一种与模型无关的局部解释方法。它通过在待解释实例附近采样并用一个简单的可解释模型如线性模型来局部近似复杂黑盒模型的预测行为。其目标是最小化以下损失函数ξ(x) argmin_{g∈G} L(f, g, π_x) Ω(g)其中f是复杂模型g是可解释模型π_x是定义采样点与实例x接近程度的度量L是损失函数Ω(g)衡量模型g的复杂度。SHAP基于博弈论中沙普利值的解释方法。它将模型预测值归因于各个输入特征。特征i的沙普利值φ_i计算公式如下φ_i Σ_{S⊆N\{i\}} [|S|! (|N|-|S|-1)! / |N|!] * [f_x(S∪{i}) - f_x(S)]其中N是所有特征的集合S是N中不包含特征i的一个子集f_x(S)是仅使用特征子集S时模型的预测值。部分依赖图显示一个或一对特征对模型预测结果的平均边际效应。对于特征x_s的PDP计算如下PDP(x_s) (1/n) Σ_{i1}^{n} f(x_s, x_{C}^{(i)})其中x_s是关注的特征x_{C}^{(i)}是第i个样本中其他特征的值n是样本总数。反事实解释通过解释需要对输入做哪些最小改变才能获得不同的预测结果来提供对模型决策的洞察。它寻找距离原始输入x最近的点x使得当输入模型时预测结果发生变化argmin_{x} d(x, x)满足 f(x) ≠ f(x)其中d是距离度量如L2范数f是模型的预测函数。总结本节课中我们一起学习了人工智能伦理的基础知识。我们探讨了公平性、隐私、透明度和问责制等核心伦理领域并通过案例研究了它们在实际中的应用。我们了解到数学在形式化定义公平准则如机会均等模型和提供强大的隐私保护工具如差分隐私方面发挥着关键作用。同时像LIME、SHAP这样的技术帮助我们打开AI黑盒增强其决策的透明度。需要强调的是这里所涵盖的内容仅仅是AI伦理领域的冰山一角。随着AI技术的指数级增长其伦理考量也在飞速发展。作为AI开发者我们始终有责任以合乎伦理的方式进行工作而数学将持续为这一领域带来所需的严谨性。017深度学习中的结构化概率建模 在本节课中我们将学习如何将神经网络应用于实际场景并探讨如何通过结构化概率模型来系统性地处理预测中的不确定性。我们将介绍概率模型的基本概念、核心方法及其在深度学习中的集成应用。概述现实世界的数据和预测充满了不确定性。结构化概率模型为我们提供了一个数学框架用于表示和推理具有不确定性的系统。通过将概率理论与神经网络结合我们可以量化不同结果的可能性并在新信息到来时更新我们的认知。什么是结构化概率模型上一节我们介绍了课程的目标本节中我们来看看结构化概率模型的核心定义。结构化概率模型本质上是基于概率理论的数学框架。它们用于表示和推理那些表现出不确定性的系统。神经网络所做的每一个预测都带有某种不确定性我们需要找到处理这种不确定性的方法。我们通过编码世界所有可能状态的知识以及每个状态发生的可能性来实现这一点。这些模型提供了一种结构化的方式来管理不确定性。推理过程使我们能够量化各种结果的概率并对所有不确定性进行推理。其核心在于概率模型建立在概率论的基础上这使我们能够以严谨的方式表示不确定性。我们利用概率分布来描述系统中变量的不确定性并使用这些分布进行预测、做出推断并在新信息到来时更新信念。概率模型的作用与重要性理解了基本概念后我们来看看为什么这些模型如此重要。概率模型在捕捉现实世界现象固有的不确定性方面起着至关重要的作用。它们的重要性源于能够正式地量化和管理不确定性。在处理真实、非学术性的、不“干净”的数据时我们必须能够处理无处不在的不确定性。以下是概率模型的主要作用量化不确定性对预测中的不确定性进行度量。整合先验知识将已有的领域知识纳入模型。更新信念随着新信息的到来更新模型的认知。在不确定性下做出决策为关键决策提供依据。进行预测构建预测模型。理解复杂系统分析系统内部的风险和不确定性。优化资源分配基于概率评估进行更高效的资源配置。与深度学习的关键集成技术了解了模型的作用接下来我们看看如何将概率模型与深度学习相结合。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-nn-bsc/img/8c6cc4fa5d0dd3fee6073981b276607b_1.png以下是三种关键的集成技术贝叶斯神经网络通过引入权重的先验分布来量化模型本身的不确定性。变分自编码器将神经网络与概率图模型结合用于生成任务。深度高斯过程使用深度神经网络学习特征表示作为高斯过程的输入。贝叶斯神经网络详解上一节我们列出了几种集成技术本节中我们深入探讨第一种贝叶斯神经网络。贝叶斯神经网络通过应用贝叶斯统计学来估计网络权重的不确定性从而扩展了传统的神经网络。在标准神经网络中权重从数据中学习并固定下来这暗示了对预测模型有某种程度的置信度。相比之下贝叶斯神经网络将权重视为随机变量并赋予其概率分布。这意味着权重不是固定的。这种方法允许贝叶斯网络表达模型预测中的不确定性并提供了一个强大的框架在决策制定至关重要的应用中尤其有用例如医疗结果预测。其核心思想是整合关于权重的先验知识并根据新的观察结果更新这些知识。贝叶斯神经网络学习的是权重的分布该分布反映了在看到数据之前对权重的先验信念以及在给定权重下观察到数据的可能性。其数学公式基于贝叶斯定理P(W|D) [P(D|W) * P(W)] / P(D)其中P(W|D)是给定数据D后权重W的后验分布P(D|W)是似然函数P(W)是先验分布P(D)是证据或边缘似然。优势提供预测的不确定性估计对医疗、自动驾驶、金融等领域至关重要。对过拟合更加鲁棒尤其是在小数据集上。能够整合先验知识。挑战计算成本高昂计算权重上的后验分布非常耗时。后验分布难以精确计算由于神经网络参数空间维度极高精确计算后验分布通常是不可行的。处理计算挑战的近似方法由于精确计算后验分布非常困难我们需要使用近似方法。以下是几种常见的近似技术变分推断用一个更简单的分布来近似真实的后验分布通过最小化两个分布之间的散度来实现。它将问题转化为一个优化问题计算上更可行。马尔可夫链蒙特卡洛方法直接从后验分布中采样而无需显式计算它。虽然强大但其本身计算量也可能很大。拉普拉斯近似用一个以最大后验估计为中心的高斯分布来近似后验。计算更简单但在高维空间中可能无法很好地捕捉后验的真实形状。Dropout 近似在测试时使用Dropout已被提出作为一种实用的贝叶斯推断近似方法能以计算高效的方式估计不确定性。量化不确定性偶然 vs 认知贝叶斯神经网络的一个关键优势是能够量化两种不同类型的不确定性。偶然不确定性也称为统计不确定性源于数据固有的随机性。这种不确定性无法通过收集更多数据来减少。它通常与数据中的噪声相关。在模型中可以通过为输出层假设一个噪声分布如高斯分布来直接建模。其数学表示可以为P(y|x, W) N(f(x; W), σ²(x; W))其中f(x; W)是均值预测σ²(x; W)是噪声方差。认知不确定性也称为模型不确定性源于对底层系统缺乏完整了解。它代表了关于模型本身如结构、参数的不确定性。与偶然不确定性不同认知不确定性可以通过收集更多数据来减少。贝叶斯神经网络通过将权重视为随机变量具有后验分布P(W|D)来量化这种不确定性。计算或近似这个分布可以评估我们的信念如何随数据变化。通过整合所有可能的权重贝叶斯神经网络可以计算新输入的预测分布该分布同时包含了偶然和认知不确定性。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-nn-bsc/img/8c6cc4fa5d0dd3fee6073981b276607b_3.png马尔可夫链蒙特卡洛方法另一种重要的近似方法是MCMC。MCMC是一类用于从复杂概率分布中采样的算法。它们通过构建一个马尔可夫链来生成样本该链以目标概率分布作为其平稳分布。其思想是从一个任意点开始迭代地在样本空间中移动到新点设计的转移概率使得链最终收敛到目标分布。Metropolis-Hastings算法是其中的关键它通过基于接受概率来接受或拒绝提议的移动从而实现从目标分布中采样。Gibbs采样是MH算法的一个特例其中移动总是被接受。它通过顺序地采样每个变量以其他变量的当前值为条件来工作在高维但结构化的空间中很实用。在深度学习中的应用贝叶斯深度学习用于近似神经网络权重的后验分布。不确定性估计通过从后验分布中采样估计深度学习模型中的预测不确定性这对自动驾驶、医疗诊断等应用至关重要。挑战直接应用于深度学习模型面临高维参数空间和计算成本的挑战。变体如哈密顿蒙特卡洛和随机梯度MCMC已被开发出来以提高效率。真实世界案例研究最后我们通过一些案例来看看结构化概率模型的实际影响力。结构化概率模型通过整合对不确定性的细致理解显著增强了深度学习在许多领域的应用。以下是几个值得注意的案例图像生成与VAEs变分自编码器利用结构化概率模型学习数据的潜在表示在图像生成领域极具影响力。例如VAE被用于从CelebA等数据集中生成高质量、多样化的人脸图像捕捉了细微的面部特征和变化。自然语言处理与LDA潜在狄利克雷分配是一种用于发现文档主题结构的概率模型。与神经网络结合后LDA可以增强主题发现和文本生成过程。例如用LDA增强的深度学习模型在文本分类和生成任务中表现出色产生了更连贯的主题和文本。语音识别与DMMs深度马尔可夫模型结合了深度学习和隐马尔可夫模型能更有效地建模序列数据。它们被用于增强语音识别系统为处理音频中的时间变化和噪声提供了更鲁棒的框架。自动驾驶与贝叶斯网络贝叶斯神经网络被用于自动驾驶中预测其他车辆和行人的行为并关联不确定性从而增强了在不确定环境中的决策过程。药物发现与图神经网络图卷积神经网络与概率模型结合已被用于预测分子性质和相互作用加速了药物发现过程。总结https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-nn-bsc/img/8c6cc4fa5d0dd3fee6073981b276607b_5.png在本节课中我们一起学习了结构化概率建模在深度学习中的核心作用。我们首先了解了概率模型如何为处理不确定性提供框架然后探讨了贝叶斯神经网络如何通过将权重视为随机变量来量化偶然和认知不确定性。我们还介绍了应对计算挑战的近似方法如变分推断和MCMC。最后通过多个领域的实际案例我们看到了这些技术如何解决复杂的现实世界问题从图像生成、自然语言处理到自动驾驶和药物发现。掌握这些概念将帮助你构建更稳健、可解释且能妥善处理不确定性的智能系统。