第 3 课:机器学习 vs 深度学习 vs 大模型
机器学习 vs 深度学习 vs 大模型 从“学习规律”到“通用智能接口” AI 基础认知 · 第 03 课 面向 AI 训练师 / 数据标注 / 智慧图书馆应用 分清层级 · 选择方法 · 连接岗位 为什么要区分这三个概念?…
机器学习 vs 深度学习
vs 大模型
从“学习规律”到“通用智能接口”
AI 基础认知 · 第 03 课
面向 AI 训练师 / 数据标注 / 智慧图书馆应用
分清层级 · 选择方法 · 连接岗位
为什么要区分这三个概念?
机器学习、深度学习和大模型经常被混用,但它们解决问题的方式、数据需求和训练师工作重点并不相同。
痛点一:概念模糊
只知道“都是 AI”,却说不清三者的包含关系和差异。
痛点二:方法误选
简单表格预测不一定需要大模型,开放式写作也不适合传统机器学习。
痛点三:岗位错位
不同技术路线对应不同的数据准备、标注规范和评估方式。
分清层级,才能判断任务该用什么方法、准备什么数据、投入多少资源。
学习目标
01 层级
理解机器学习、深度学习、大模型在 AI 体系中的包含关系。
02 差异
比较三者在数据量、特征工程、算力、可解释性和适用场景上的差别。
03 应用
根据任务类型选择合适技术路线,并说明 AI 训练师要做什么。
机器学习
从数据中学习规则→
深度学习
用多层网络学习表示→
大模型
大规模预训练后的通用能力
三者的层次关系

大模型 ⊂ 深度学习 ⊂ 机器学习 ⊂ 人工智能
机器学习范围最广,包含传统统计学习和神经网络。
深度学习是机器学习的子集,核心是多层神经网络。
大模型是深度学习在大数据、大算力下形成的新阶段。
机器学习:最广泛的方法集合
机器学习(Machine Learning, ML):让计算机从数据中自动学习规律,并把规律用于预测、分类、分组或决策。
| 学习范式 | 数据要求 | 目标 | 典型例子 |
|---|---|---|---|
| 监督学习 | 有标签数据 | 学会从输入预测标签 | 垃圾邮件分类、房价预测 |
| 无监督学习 | 无标签数据 | 发现隐藏结构 | 用户分群、主题聚类 |
| 半监督学习 | 少量标签 + 大量无标签 | 降低标注成本 | 文本分类扩充、图像识别 |
| 强化学习 | 状态、动作、奖励 | 学会最优行动策略 | 游戏 AI、机器人控制 |
传统机器学习适合什么?
结构化数据
表格字段清晰,如年龄、价格、借阅次数、访问频率、评分等。
样本规模较小
几百到几万条数据即可启动,常用于分类、回归、排序和异常检测。
需要可解释
决策树、线性模型等更容易解释“为什么做出这个判断”。
成本受限
训练速度快,普通电脑也能完成,适合教学、原型和轻量业务。
例:根据图书借阅记录预测某类书下月需求量,传统机器学习可能已经足够。
深度学习:让模型自动学习特征
深度学习使用多层神经网络,把原始数据逐层转换为更抽象的表示。
多层网络
“深度”指网络层数多,能够表达复杂非线性关系。
自动特征
减少人工特征工程,让模型从图像、文本、语音中自动提取模式。
资源要求高
通常需要更多数据、更强算力和更严格的训练调参。
传统 ML vs 深度学习
| 对比维度 | 传统机器学习 | 深度学习 |
|---|---|---|
| 特征工程 | 依赖人工设计字段和特征 | 模型自动学习特征表示 |
| 数据量 | 百到万级也可起步 | 通常需要万级、百万级数据 |
| 算力需求 | CPU 常可完成 | GPU 更常见 |
| 可解释性 | 相对较高 | 相对较低,更像“黑箱” |
| 适用场景 | 表格、简单文本、规则稳定任务 | 图像、语音、长文本、多模态任务 |
主要深度学习架构
| 架构 | 核心思想 | 适合任务 | 代表模型/方向 |
|---|---|---|---|
| CNN | 局部感受野与卷积特征 | 图像分类、目标检测 | ResNet、YOLO |
| RNN/LSTM | 按时间顺序处理序列 | 早期文本、语音、时间序列 | LSTM、GRU |
| Transformer | 注意力机制捕捉全局关系 | 文本、多模态、代码 | BERT、GPT、ViT |
| GAN | 生成器与判别器对抗 | 图像生成、风格迁移 | StyleGAN |
| Diffusion | 逐步去噪生成内容 | 图像、视频、音频生成 | 扩散模型 |
大模型:深度学习的大规模预训练产物
大模型不只是“参数更多”,更重要的是通过大规模预训练获得跨任务迁移和涌现能力。
| 维度 | 小模型/专用模型 | 大模型 |
|---|---|---|
| 参数规模 | 通常较小,面向单任务 | 数十亿到数千亿量级常见 |
| 训练数据 | 领域数据或标注数据 | 海量通用数据 + 多模态/行业数据 |
| 能力边界 | 单一任务效果好 | 对话、推理、写作、代码、工具调用等 |
| 使用方式 | 训练后部署到固定任务 | 提示词、微调、RAG、Agent 等多种方式 |
大模型的核心特征:规模带来的通用性、迁移性和新能力。
大模型的涌现能力

涌现能力不是线性增加,而是在规模达到某个范围后明显出现。
表现复杂推理、少样本学习、跨语言迁移、代码生成等。
边界涌现不等于可靠,仍需评测、约束和人工反馈。
代表性大模型类型
| 类型 | 主要能力 | 典型用途 | 训练师关注点 |
|---|---|---|---|
| 文本大模型 | 对话、摘要、写作、翻译 | 智能客服、知识问答、文案生成 | 指令数据、偏好数据、事实评估 |
| 多模态大模型 | 图文理解、视觉问答、图像生成 | 文档理解、海报生成、医学影像辅助 | 图文对齐、标注一致性 |
| 代码大模型 | 代码生成、解释、调试 | 编程助手、自动化脚本 | 代码质量、测试样例、安全性 |
| 行业大模型 | 领域知识与流程适配 | 法律、医疗、教育、图书馆 | 领域语料、合规、专家评审 |
三者的数据需求对比
| 指标 | 传统 ML | 深度学习 | 大模型 |
|---|---|---|---|
| 数据规模 | 小到中等 | 中到大 | 极大规模预训练语料 |
| 标注方式 | 表格标签、少量人工标注 | 图像/文本/语音精细标注 | 指令、偏好、评测集、领域语料清洗 |
| 数据质量重点 | 字段完整、标签准确 | 标注一致、覆盖多样 | 去重、去噪、安全、版权、事实性 |
| 训练师工作重点 | 整理字段、标签校验 | 标注规范、质检闭环 | 数据治理、指令构造、评测与反馈 |
实际工作流程对比
传统 ML
收集表格数据 → 清洗字段 → 标签整理 → 训练分类/回归模型 → 指标评估。
深度学习
采集多媒体数据 → 格式转换 → 标注平台 → 质量检查 → 模型训练与错例分析。
大模型
语料清洗 → 指令设计 → SFT 数据 → 偏好数据 → 安全评估 → RAG/Agent 集成。
技术越“通用”,越需要系统化的数据治理和评估反馈。
如何根据任务选择方法?
| 任务 | 推荐路线 | 原因 |
|---|---|---|
| 判断邮件是否为垃圾邮件 | 传统 ML / 深度学习 | 标签清晰,分类任务明确 |
| 从大量图片中识别猫狗 | 深度学习 | 图像特征复杂,CNN/ViT 更合适 |
| 写一篇 500 字新闻报道 | 大模型 | 开放式生成,需要语言组织能力 |
| 预测明天温度 | 传统 ML / 时间序列模型 | 数值预测,结构化历史数据为主 |
| 将中文翻译成阿拉伯语 | 大模型 / 神经机器翻译 | 需要跨语言语义迁移 |
智慧图书馆场景:三类技术怎么用?
传统 ML
预测图书借阅趋势、读者分群、异常访问检测。
深度学习
OCR 识别扫描文档、图像分类、语音转写、文献主题识别。
大模型
智能咨询、文献综述辅助、多语种问答、馆藏知识库 RAG。
训练师任务
定义标签、清洗语料、构建评测集、记录错例、推动持续迭代。
课堂练习:判断模型类型
请为下列任务选择“传统 ML / 深度学习 / 大模型”,并写出数据准备重点。
| 任务 | 方法判断 | 数据准备重点 |
|---|---|---|
| 图书借阅量预测 | ? | 历史借阅记录、时间、类别、节假日 |
| 扫描书页 OCR 识别 | ? | 清晰图片、版面标注、文字校对 |
| 读者咨询自动回复 | ? | FAQ、馆规、历史问答、评测问题 |
| 读者群体聚类 | ? | 借阅类别、访问频率、匿名化用户特征 |
| 文献摘要生成 | ? | 论文全文、摘要样例、事实核查规则 |
常见误区
误区一:越大越好
大模型强,但成本、延迟、隐私和可控性也更复杂。
误区二:深度学习不需要特征
虽然模型自动学习特征,但数据预处理、标签体系和任务设计仍然关键。
误区三:有模型就有结果
模型只是系统的一部分,评测、反馈、合规和上线监控同样重要。
本节课总结与作业
必须掌握
大模型 ⊂ 深度学习 ⊂ 机器学习 ⊂ 人工智能。
核心判断
任务越开放、数据越复杂,越可能需要深度学习或大模型。
岗位连接
AI 训练师在不同技术路线中都要围绕数据质量、标注规范和评估反馈工作。
课后作业
- 用一个生活类比解释 ML / DL / 大模型的关系。
- 各举一个传统 ML、深度学习、大模型的真实应用案例。
- 思考:大模型时代还需要数据标注员和 AI 训练师吗?为什么?
- 选做:为“智慧图书馆咨询助手”设计 5 条评测问题。
考试实操 20:任务单
| 项目 | 要求 |
|---|---|
| 考核等级 | 五级/初级:概念识别、规范执行、基础标注与质检 |
| 业务场景 | 准备大模型微调或评估数据 |
| 原始材料 | 指令样本、偏好对、知识库文档 |
| 限时要求 | 20 分钟完成小样本,40 分钟完成批量与质检 |
| 提交物 | jsonl数据 + 评测集 + 风险说明 |
评分重点:过程可复现、结果可检查、异常有记录。
考试实操 21:样本表设计
| 样本编号 | 样本内容 | 处理要求 | 预期记录 |
|---|---|---|---|
| S01 | instruction:请用中文解释馆际互借流程;answer:分步骤回答 | 按标准流程处理 | 正常样本 |
| S02 | preference_pair:A回答有事实错误,B回答引用馆规 | 查阅规则后处理 | 边界说明 |
| S03 | rag_doc:数据库使用说明第3段,需切分并写metadata | 标记并提交复核 | 异常原因 |
要求:不得只写结论,必须写出判断依据或处理参数。
考试实操 22:小样本试跑
- 从材料中抽取 5 条代表样本:
instruction:请用中文解释馆际互借流程;answer:分步骤回答、preference_pair:A回答有事实错误,B回答引用馆规、rag_doc:数据库使用说明第3段,需切分并写metadata至少各覆盖 1 条。 - 先手工完成 2 条,确认“机器学习 vs 深度学习 vs 大模型”的口径、字段、工具设置没有歧义。
- 再执行:构造 5 条指令/偏好/RAG 样本,完成格式校验和安全检查。
- 将错例写入
error_cases.csv,字段包含:样本ID、错误类型、修正依据、复核人。
小样本试跑不过关,不进入批量处理。
考试实操 23:操作步骤
Step 1
读取题目材料:指令样本、偏好对、知识库文档。→Step 2
构造 5 条指令/偏好/RAG 样本,完成格式校验和安全检查。→Step 3
提交:jsonl数据 + 评测集 + 风险说明。
禁止操作:临时改标签、覆盖原始文件、不记录异常、只提交截图不交数据。
考试实操 24:质量检查清单
- 原始数据已备份,处理文件另存为新版本
- “机器学习 vs 深度学习 vs 大模型”相关规则已写入 README 或报告
- 至少抽检 10% 样本,且覆盖边界样本
- 指标检查:格式合规、指令清晰、事实核查
- 所有异常样本都有编号、原因和处理意见
质检记录是考试给分点,不是可选项。
考试实操 25:错例分析
| 错误类型 | 本课常见表现 | 修正方法 |
|---|---|---|
| 口径错误 | “机器学习 vs 深度学习 vs 大模型”判断标准前后不一致 | 回到规则表统一定义 |
| 格式错误 | 文件字段、编码、命名不符合要求 | 按模板重新导出 |
| 漏标漏处理 | 边界样本未进入复核 | 建立待确认列表 |
| 不可追溯 | 没有记录参数、版本或来源 | 补充处理日志 |
复盘要求:至少写 2 条错例及修正依据。
考试实操 26:智慧图书馆应用
场景
准备大模型微调或评估数据,服务对象为读者、馆员或科研团队。
数据
指令样本、偏好对、知识库文档,需注意来源、权限和个人信息。
处理
把“机器学习 vs 深度学习 vs 大模型”方法嵌入采集、标注、训练或评估流程。
验收
用 格式合规、指令清晰、事实核查 判断是否达到交付要求。
考试实操 27:评分细则
| 评分项 | 分值 | 扣分点 |
|---|---|---|
| 数据准备 | 20 | 来源不明、字段缺失、未备份 |
| 操作执行 | 30 | 步骤跳跃、参数错误、结果不可复现 |
| 质量检查 | 30 | 无抽检、无错例、无指标解释 |
| 交付规范 | 20 | 文件命名混乱、缺少README、无法打开 |
满分答案通常包含:结果 + 过程 + 质检 + 复盘。
考试实操 28:提交包结构
第03课_机器学习 vs 深度学习 vs 大模型_考试提交包/
├── raw/ # 原始材料,只读保存
├── output/ # jsonl数据 + 评测集 + 风险说明
├── qc/ # 抽检表、错例表、指标计算
├── screenshots/ # 关键步骤截图
└── README.md # 工具版本、步骤、结论、风险检查:压缩包解压后,阅卷老师能按 README 复现主要结果。
考试实操 29:限时训练
10 分钟版
- 读题并建立
raw/output/qc目录 - 处理 3 条样本:正常、边界、异常各 1 条
- 写出 1 条与“机器学习 vs 深度学习 vs 大模型”直接相关的边界规则
30 分钟版
- 按要求完成:构造 5 条指令/偏好/RAG 样本,完成格式校验和安全检查
- 做 10% 抽检并解释 格式合规、指令清晰、事实核查
- 生成 jsonl数据 + 评测集 + 风险说明
60 分钟版
- 批量处理 + 指标计算 + 质量报告
- 给出下一轮优化建议
考试实操 30:口头答辩题
- 本课“机器学习 vs 深度学习 vs 大模型”任务的输入、输出分别是什么?
- 如果结果不达标,你会优先检查数据、规则、工具还是人员执行?为什么?
- 本次提交物如何证明可追溯?
- 在智慧图书馆项目中,哪些数据不能直接用于训练?
答辩时要结合样本编号和处理记录,不要只背概念。
大学生学习拓展:从通识到岗位:大学生为什么要懂AI训练
本页为大学生培训增强内容:把本课知识连接到真实校园、科研与就业场景。
拓展 1
AI不是一个单独软件,而是数据、算法、算力、场景共同构成的系统工程。
拓展 2
大学生要从“会用AI工具”升级为“能判断数据质量、模型边界和应用风险”。
拓展 3
本模块建立AI训练师职业认知,为后续标注、质检、建模和项目管理打基础。
知识加餐:本课在AI项目中的位置
| 维度 | 大学生需要掌握 | AI训练师工作对应 |
|---|---|---|
| 概念 | 能用自己的话解释 机器学习 vs 深度学习 vs 大模型 | 面向客户/团队讲清任务边界 |
| 操作 | 能完成一个最小可运行任务 | 形成可验收交付物 |
| 质量 | 能发现错误、记录问题、复核结果 | 支撑模型效果与责任追溯 |
| 合规 | 能说明数据来源、隐私与版权风险 | 满足项目审计和上线要求 |
课堂实训升级:从“听懂”到“做出来”
建议实训任务(五级/基础)
- 画出AI、机器学习、深度学习、大模型、智能体之间的层级图。
- 任选一个校园AI应用,说明它需要哪些数据、模型和评估指标。
交付物建议:数据文件 / 处理脚本 / 截图证据 / 1页说明 / 课堂展示。
工具链建议:国产模型 + 本地工具 + 可复现记录
数据与标注
Excel/WPS、Label Studio、CVAT、JSONL/CSV、抽样质检表。
模型与评估
Qwen、DeepSeek、BGE-M3、RAG、LoRA、F1/Recall/MRR等指标。
记录与展示
Jupyter、Markdown、Git/版本记录、PPT答辩、学习档案。
课堂讨论与课后反思
- 本课内容如果用于智慧图书馆,会服务哪个具体场景?
- 本课最容易出现的数据质量问题是什么?如何检查?
- 哪些数据不能直接进入训练或评估?为什么?
- 如何把本课成果放进个人作品集?
- 如果你是项目负责人,本课对应的验收指标是什么?