大模型技术全景(一):AI、机器学习、深度学习,三者的关系到底是什么?一文搞懂

大模型技术全景(一):AI、机器学习、深度学习,三者的关系到底是什么?一文搞懂 很多人能调 API、会写 Prompt,却答不上大厂面试的经典第一问:人工智能、机器学习、深度学习、大语言模型,到底是什么关系?答不上不怪你——大家都是从工具使用倒着学回来的:先会聊天,再会调参,最后才回头补地基。本文把这块地基一次夯实。主线:AI → ML → DL → 大模型,四个词不是并列,而是一层套一层的包含关系。目录目录​编辑目录一、人工智能AI模拟智能行为分强/弱二、机器学习MLAI 的手段本质是自动找 f(x)≈y三、五种学习方式监督 / 无监督 / 半监督 / 自监督 / 强化3.1 监督学习Supervised Learning3.2 无监督学习Unsupervised Learning3.3 半监督学习Semi-supervised Learning3.4 自监督学习Self-Supervised Learning3.5 强化学习Reinforcement Learning3.6 汇总表四、按任务分分类 / 回归 / 聚类 / 关联 / 序列4.1 分类Classification4.2 回归Regression4.3 聚类Clustering4.4 关联规则Association Rule Learning4.5 序列预测Sequence Prediction4.6 汇总表五、深度学习DL神经网络的参数学习六、从 DL 走到生成式 AI 与大模型七、易混点对比与前面文章衔接八、常见误区九、面试官追问6 个 答案一、人工智能AI模拟智能行为分强/弱定义:人工智能(Artificial Intelligence, AI)是研究、开发用于模拟、延伸、扩展人类智能的理论方法与应用系统的学科。一句话:让机器展现聪明的决策行为。小爱同学、宇树 H1 机器人、DeepSeek 都是 AI;早期 AI 靠人工规则(当发生 A,则做 B),现在主流靠数据驱动。关键认知:当前 AI 在模仿智能的行为,而非复制本质。学界分两条路:路线目标现状强人工智能造出有心智、有自我意识的机器不存在,纯愿景弱人工智能在特定领域表现智能、做得比人好所有落地 AI 都在这条路二、机器学习MLAI 的手段本质是自动找 f(x)≈y定义:机器学习(Machine Learning, ML)是 AI 的一个子领域,核心不再是手动写规则,而是通过数据训练算法,让计算机从历史样本中自动总结规律,用来预测或决策新问题。关系一句话:AI 是目标,ML 是实现目标的主要手段,当代 AI ≈ 基于 ML 的 AI。本质:给定输入 x 和输出 y,让机器自己找到函数f(x)≈y。打车例子:起步价 10 元、每公里 2 元。人不算,直接看样本猜规律——只给 (1,12)、(2,14)、(3,16),机器设yaxb自动解出 a2、b10,于是预测 20 公里50 元。术语含义特征 x输入的原始素材公里数标签 y标准答案费用训练自动解参数 a、b 的过程推理/预测用训练好的模型算新 x 的 y类比失效点:真实任务的 x 是图片、语音、文本,参数几万几十万,根本写不出y2x10这种公式。比如图里是车还是人,函数形如车/人 f(图片),参数海量且不可解释。三、五种学习方式监督 / 无监督 / 半监督 / 自监督 / 强化按训练数据有没有标注、反馈信号从哪来,机器学习分成五种。记忆口诀:信号从哪来,决定是哪种学习。3.1 监督学习Supervised Learning定义:用标记好(带标准答案)的数据训练,模型学习输入与输出之间的映射关系。靠人工标签反馈,有对错、直接纠正——照答案做题。例子:鸢尾花数据集(150 个样本,4 个特征 3 种品种标签);垃圾邮件识别。算法:KNN、逻辑回归、朴素贝叶斯、决策树、随机森林、SVM。3.2 无监督学习Unsupervised Learning定义:在完全没有标签的情况下,让算法自行从数据中发现隐藏的结构和规律。靠数据内在结构反馈,没有对错,只找规律——自己找规律。例子:电商把买尿不湿的女性聚成一类(还常买奶粉、湿巾),业务上叫宝妈群体。算法:K-means、层次聚类、DBSCAN、GMM。3.3 半监督学习Semi-supervised Learning定义:用少量有标签 大量无标签数据一起训练,提升预测精度。介于监督和无监督之间。例子:X 光片辅助诊断。500 张医生标注的片子训初始模型 → 预测 1 万张无标签片 → 挑 99% 置信度的打伪标签→ 加入训练集重训。效果示意:500 真标签 75% / 5000 真标签 90% / 500 真4500 无标签 88%。代价:伪标签一旦错,错误会随训练放大。3.4 自监督学习Self-Supervised Learning定义:让数据自己标注自己——隐藏一部分,让模型预测这部分,自动生成监督信号。完全不用人工标签,是大模型预训练的核心范式。例子 1(扩散模型):往清晰图撒噪→让模型还原被遮住的画面,答案在自己手里。例子 2(BERT 掩码语言模型):把句子挖掉一个词,让模型猜被挖的词。和半监督的区别:半监督仍依赖少量真实标签,自监督完全不用标签。3.5 强化学习Reinforcement Learning定义:通过与环境交互试错来学习,没有标签,靠奖励/惩罚优化行为策略,目标是长期累积奖励最大化。例子:AlphaGo 三阶段——①监督学棋谱模仿人类 → ②强化左右互搏数百万局,赢就是奖励,下出人类没见过的第 37 手 → ③AlphaGo Zero 纯强化,只给规则,40 天 100:0 完胜旧版。代价:样本效率极低,要试错百万局,训练不稳定。3.6 汇总表范式一句话定义反馈信号有标签?代表监督照标准答案做题人工标注有Iris、垃圾邮件识别无监督自己找数据内在规律数据结构无K-means 用户聚类半监督少量真标签大量无标签真标签伪标签少量X 光片辅助诊断自监督数据自己标注自己数据自动构造无(自造)BERT 掩码、扩散模型强化试错中追长期收益环境奖励(延迟)无(奖励替代)AlphaGo、RLHF*RLHF(人类反馈强化学习):靠人类打分当奖励信号,是 ChatGPT 类模型训练的关键技术,后面讲大模型训练时展开。四、按任务分分类 / 回归 / 聚类 / 关联 / 序列除了按反馈信号分,还能按学什么任务分,面试常混着考。4.1 分类Classification定义:把输入数据划分到预先定义好的离散类别中,输出是一个类别标签。例子:判断邮件是正常还是垃圾。算法:KNN、逻辑回归、朴素贝叶斯、决策树、随机森林、SVM。4.2 回归Regression定义:建立一个数学模型,拟合输入特征与连续数值型输出之间的映射关系,输出是一个数。例子:用 500 天历史数据训出明天收盘价 a×今天收盘价 b×今天成交量 c,预测股价。算法:线性回归。4.3 聚类Clustering定义:在没有类别标签的情况下,根据数据样本之间的内在相似性,自动将其划分为若干簇。例子:音乐 App 把歌按速度/能量/人声/情绪特征聚成燃爆运动/深夜 emo/学习专注等堆,再给你推同堆的歌。算法:K-means、层次聚类、DBSCAN、GMM。4.4 关联规则Association Rule Learning定义:从大规模数据集中,发现变量之间的**X→Y共生依赖模式**。例子:啤酒尿布——买尿布的年轻父亲往往顺便买啤酒(课件提醒:此为商业寓言,真实性存疑,但其背后的关联规则挖掘理论影响深远)。算法:Apriori、FP-Growth。4.5 序列预测Sequence Prediction定义:利用数据点之间的顺序依赖关系,预测下一个元素。例子:机器翻译我 爱 学习→ 一个词一个词预测出 I love learning。算法:RNN、LSTM、GRU、Transformer*。* Transformer 是当前所有大模型(GPT、DeepSeek)的底层架构,后面专篇深入讲。4.6 汇总表任务一句话定义监督?例子代表算法分类把输入归到预定义离散类别监督垃圾邮件判断KNN、逻辑回归、SVM回归拟合输入与连续数值输出的映射监督预测明天股价线性回归聚类按相似度自动分成若干簇无监督音乐 App 分组推荐K-means、DBSCAN关联规则发现X→Y共生依赖模式无监督啤酒尿布(寓言,真实性存疑)Apriori、FP-Growth序列预测利用顺序依赖预测下一步监督机器翻译逐词生成RNN、LSTM、Transformer*五、深度学习DL神经网络的参数学习定义:深度学习(Deep Learning, DL)是机器学习的分支,通过构建多层神经网络实现学习。ML 要学几百万参数,这些参数怎么存?就是神经网络。神经网络的参数学习 深度学习。结构:输入层 → 隐藏层(可多个)→ 输出层。隐藏层越多网络越深,这就是深度二字的来历。本质公式:传统 ML 是yf(x),DL 写成y f(...f(f(x))...),每层都在上一层结果上加工,信息越来越抽象。核心案例:AI 判断西红柿炒鸡蛋——像后厨流水线,每个师傅只干一道工序:站点工序学到什么输入层照片拆成像素矩阵原始像素隐藏层 1有没有大量红色黄色颜色特征隐藏层 2红色块状?黄色絮状?形状特征隐藏层 3红黄是否交错混合?空间关系特征输出层满足全部条件→是最终结论三个悟透点:①隐藏层——你只看得到是/不是结果,中间报告是隐藏的;②自动学特征——师傅不是人类教的,是 AI 看几万张图自己总结的,这是 DL 与传统 ML 最大区别;③嵌套——不经过像素→颜色→形状→混合链,AI 无法从原始像素蹦到结论。为什么叫深度:就是层数多。Transformer Base 12 层 → GPT-1 12 层 → GPT-3 96 层 → GPT-4 120 层。DL vs 传统 ML(四维对比):维度传统 ML深度学习特征提取人工设计特征工程端到端自动学特征可解释性强,推理路径清晰弱,黑盒数据依赖小样本更稳大数据下才有压倒性优势计算资源低训练需 GPU/TPU,投入巨大判断标准:是不是深度学习,看是否端到端自动学特征(从原始输入直接到最终输出,中间不手工加工特征),不是数层数。六、从 DL 走到生成式 AI 与大模型生成式 AI(GenAI):能根据输入自主创造全新内容(文本/图像/音频/视频/代码)的 AI。判别式 vs 生成式(本质区别):判别式 AI(传统 AI):精准的判断者,从已有数据识别模式——人脸识别、推荐商品,输出是判断/分类。生成式 AI:有创意的创作者,学习数据规律后生成从未存在的内容——文生图、写文章。数学本质:传统:y f(x),固定函数,23 必得 5,像计算器;生成式:y ~ P(x)(y 服从 x 的概率分布),按概率掷骰子,像懂行的赌徒——这就是为什么问 ChatGPT 同样的问题,每次回答字眼都不一样。GenAI 严格说不属于深度学习,但目前的实现几乎都基于深度学习(太复杂,只能靠 DL 实现)。终极关系图:AI目标 ├── ML手段── 实现 AI 的主要方式 │ ├── 传统 MLSVM、决策树 │ └── DL神经网络自动学特征 │ └── LLMDL 在语言上的应用如 GPT、DeepSeek └── GenAI基于 DL 实现跨文本/图像/音视频易混点:LLM 本质是深度学习模型在语言上的应用,属于DL ⊂ ML ⊂ AI;但 BERT 这类只理解不生成的模型也算大模型,却不擅长生成——并非所有大模型都是生成式 AI。七、易混点对比与前面文章衔接本篇 vs 《大模型全景入门》:那篇站在 LLM 肩膀上看应用提示词;本篇拉到 LLM 脚下讲地基。答案:大模型 海量数据自监督预训练 下游微调的深度学习模型,属于 DL ⊂ ML ⊂ AI。本篇 vs 《从 Vibe Coding 到 LangGraph》:Vibe Coding 深度拆解那篇已有,本篇不重复。埋种子:自监督、序列预测/Transformer 后面 LangChain、Agent 系列会反复用到。八、常见误区ML DL(并列)?错,DL ⊂ ML ⊂ AI。强化学习 无监督?错,强化靠环境奖励(有数值反馈),无监督靠数据结构(无反馈)。数据越多越好?错,伪标签错标会放大;分布偏移(训练数据和真实场景不一致,比如训练全用白天图片、线上全是夜间图)会让模型线上翻车。AI 写规则?早期是,现在主流是数据驱动。层数多就是深度学习?关键在自动学特征,不在层数。九、面试官追问6 个 答案Q1:现在的大模型属于强 AI 还是弱 AI?A:弱 AI。只在语言任务表现智能,没有心智和自我意识。强 AI 目前不存在。Q2:监督和半监督的本质区别?A:监督全部数据有真标签;半监督少量真标签 大量无标签,靠伪标签变现无标签数据。前提是专家标注成本极高、无标签数据海量。代价是伪标签错误可能传播。Q3:自监督和无监督啥关系?给个代表任务。A:自监督是无监督的特殊形式。区别:无监督靠内在结构找模式;自监督主动隐藏数据让模型预测,过程像监督。代表:BERT 掩码语言模型、扩散模型加噪/去噪。Q4:为什么 AlphaGo 用强化学习能下出人类没见过的第 37 手?A:监督学习在模仿人类棋谱,天花板是人类水平;强化学习靠左右互搏 赢棋奖励自我探索,不受人类棋谱束缚,能发现人类知识边界外的下法。Q5:深度学习比传统 ML 的工程价值在哪?代价呢?A:价值是端到端自动提特征,省掉特征工程,能啃图像/语音这类原始数据。代价是算力投入大、可解释性差、小数据反而易过拟合(模型死记训练数据、换新数据就失灵,像学生只背答案不会变通)。Q6:生成式 AI 和判别式 AI 的本质区别?大模型属于哪类?A:判别式学 P(y|x),给定输入判断类别(如人脸识别),是固定 yf(x);生成式学数据分布 P(x),能创造新内容,是 y~P(x) 采样。GPT 系属于生成式 AI;BERT 这类只理解不生成的属于判别式/编码器型。如果这篇帮你把 AI/ML/DL 的迷雾拨开了,欢迎点赞收藏。评论区聊聊:你第一次被大模型惊到是在哪个场景?