第 65 课:三大学习范式
三大学习范式 从核心概念到训练师实战 模型训练基础 · 第 65 课 面向 AI 训练师 / 数据标注 / 智慧图书馆应用 理解概念 · 掌握流程 · 连接岗位 为什么学习《三大学习范式》?…
三大学习范式
从核心概念到训练师实战
模型训练基础 · 第 65 课
面向 AI 训练师 / 数据标注 / 智慧图书馆应用
理解概念 · 掌握流程 · 连接岗位
为什么学习《三大学习范式》?
本课把“三大学习范式”放入 AI 训练师的真实工作流中,帮助你从概念理解走向可执行的项目实践。
痛点一:概念不清
只记住名词,无法判断它在数据、模型或项目流程中的作用。
痛点二:流程不稳
知道要做什么,却缺少可复用的步骤、模板和质量检查标准。
痛点三:应用脱节
无法把课堂知识迁移到智慧图书馆、多语种数据和真实标注任务中。
学习目标:把知识点转化为可执行、可检查、可交付的训练任务。
学习目标
01 理解
说清本课核心概念、适用场景与边界条件。
02 操作
掌握关键流程、常用工具和基础检查方法。
03 应用
能把本课方法迁移到数据标注、质检、模型评估或项目管理中。
概念
是什么→
流程
怎么做→
交付
如何验收
65.1 监督学习
监督学习:使用有标签的数据训练模型
流程:
输入 → 模型 → 预测 → 比较预测与真实标签 → 更新模型常见任务:
| 任务 | 输入 | 输出 |
|---|---|---|
| 分类 | 文本/图像 | 离散类别 |
| 回归 | 特征向量 | 连续数值 |
标注数据正是用于监督学习。训练师的工作质量直接影响模型效果
65.2 无监督学习
无监督学习:使用无标签数据,让模型自己发现结构
常见任务:
- 聚类:自动分组(如用户分群)
- 降维:减少特征维度(如 PCA)
- 异常检测:发现离群点
与训练师的关系:
- 无监督学习可以减少标注工作量
- 聚类结果可以作为预标注,人工修正
- 异常检测可以辅助数据清洗
65.3 半监督学习
半监督学习:少量标注 + 大量无标签数据
训练过程:
1. 用少量标注数据训练初始模型
2. 用模型预测无标签数据 → 取高置信度的预测
3. 将高置信度预测加入训练集
4. 重复 2-3 步意义:标注成本降低 50-80%,效果接近全监督
65.4 课堂练习
判断以下场景属于哪种学习范式:
| 场景 | 范式 |
|---|---|
| 用 1000 条标注评论训练情感分类器 | ? |
| 将客户分为 VIP/普通/沉睡三类(无标签) | ? |
| 用 100 条标注 + 10000 条未标注训练意图识别 | ? |
| 预测明天的气温 | ? |
| 从购物记录中发现异常账号 | ? |
动手实践
任务1: 按课堂演示步骤独立完成操作
任务2: 尝试处理不同的数据/场景
任务3: 总结问题和注意事项
案例讨论
智慧图书馆场景应用
本节课方法如何在北二外图书馆使用?
- 需要准备什么数据?
- 选择什么方法/工具?
- 预期效果和挑战?
随堂测验
- 本节课最核心的方法/概念是什么?
- 解决了什么具体问题?
- 与传统方法比优势在哪?
- 实际应用中注意什么?
常见错误
错误1:概念混淆 — 不同概念混合
错误2:步骤遗漏 — 操作不完整
错误3:理解偏差 — 原理理解不准
本节课总结
| 掌握等级 | 内容 |
|---|---|
| 必须掌握 | 核心概念、关键方法 |
| 需要理解 | 技术原理、适用场景 |
| 能够操作 | 独立完成实践任务 |
课后作业
必做: 复述核心内容 + 完成练习 + 回答测验
选做: 查找行业案例 + 应用到项目
📤 下次课前提交
考试实操 14:任务单
| 项目 | 要求 |
|---|---|
| 考核等级 | 四级/中级:数据处理、脚本辅助、模型训练与评估 |
| 业务场景 | 完成一个小型机器学习建模题 |
| 原始材料 | 特征表、标签列、训练/测试划分 |
| 限时要求 | 20 分钟完成小样本,40 分钟完成批量与质检 |
| 提交物 | 模型结果 + 指标解释 |
评分重点:过程可复现、结果可检查、异常有记录。
考试实操 15:样本表设计
| 样本编号 | 样本内容 | 处理要求 | 预期记录 |
|---|---|---|---|
| S01 | 三大学习范式样本A:标准、清晰、可直接处理 | 按标准流程处理 | 正常样本 |
| S02 | 三大学习范式样本B:边界情况,需要查规则 | 查阅规则后处理 | 边界说明 |
| S03 | 三大学习范式样本C:异常或争议,需记录原因 | 标记并提交复核 | 异常原因 |
要求:不得只写结论,必须写出判断依据或处理参数。
考试实操 16:小样本试跑
- 从材料中抽取 5 条代表样本:
三大学习范式样本A:标准、清晰、可直接处理、三大学习范式样本B:边界情况,需要查规则、三大学习范式样本C:异常或争议,需记录原因至少各覆盖 1 条。 - 先手工完成 2 条,确认“三大学习范式”的口径、字段、工具设置没有歧义。
- 再执行:围绕“三大学习范式”完成考试式实操:准备数据、执行处理、质检并交付。
- 将错例写入
error_cases.csv,字段包含:样本ID、错误类型、修正依据、复核人。
小样本试跑不过关,不进入批量处理。
考试实操 17:操作步骤
Step 1
读取题目材料:特征表、标签列、训练/测试划分。→Step 2
围绕“三大学习范式”完成考试式实操:准备数据、执行处理、质检并交付。→Step 3
提交:模型结果 + 指标解释。
禁止操作:临时改标签、覆盖原始文件、不记录异常、只提交截图不交数据。
考试实操 18:质量检查清单
- 原始数据已备份,处理文件另存为新版本
- “三大学习范式”相关规则已写入 README 或报告
- 至少抽检 10% 样本,且覆盖边界样本
- 指标检查:F1/AUC/RMSE、过拟合判断
- 所有异常样本都有编号、原因和处理意见
质检记录是考试给分点,不是可选项。
考试实操 19:错例分析
| 错误类型 | 本课常见表现 | 修正方法 |
|---|---|---|
| 口径错误 | “三大学习范式”判断标准前后不一致 | 回到规则表统一定义 |
| 格式错误 | 文件字段、编码、命名不符合要求 | 按模板重新导出 |
| 漏标漏处理 | 边界样本未进入复核 | 建立待确认列表 |
| 不可追溯 | 没有记录参数、版本或来源 | 补充处理日志 |
复盘要求:至少写 2 条错例及修正依据。
考试实操 20:智慧图书馆应用
场景
完成一个小型机器学习建模题,服务对象为读者、馆员或科研团队。
数据
特征表、标签列、训练/测试划分,需注意来源、权限和个人信息。
处理
把“三大学习范式”方法嵌入采集、标注、训练或评估流程。
验收
用 F1/AUC/RMSE、过拟合判断 判断是否达到交付要求。
考试实操 21:评分细则
| 评分项 | 分值 | 扣分点 |
|---|---|---|
| 数据准备 | 20 | 来源不明、字段缺失、未备份 |
| 操作执行 | 30 | 步骤跳跃、参数错误、结果不可复现 |
| 质量检查 | 30 | 无抽检、无错例、无指标解释 |
| 交付规范 | 20 | 文件命名混乱、缺少README、无法打开 |
满分答案通常包含:结果 + 过程 + 质检 + 复盘。
考试实操 22:提交包结构
第65课_三大学习范式_考试提交包/
├── raw/ # 原始材料,只读保存
├── output/ # 模型结果 + 指标解释
├── qc/ # 抽检表、错例表、指标计算
├── screenshots/ # 关键步骤截图
└── README.md # 工具版本、步骤、结论、风险检查:压缩包解压后,阅卷老师能按 README 复现主要结果。
考试实操 23:限时训练
10 分钟版
- 读题并建立
raw/output/qc目录 - 处理 3 条样本:正常、边界、异常各 1 条
- 写出 1 条与“三大学习范式”直接相关的边界规则
30 分钟版
- 按要求完成:围绕“三大学习范式”完成考试式实操:准备数据、执行处理、质检并交付
- 做 10% 抽检并解释 F1/AUC/RMSE、过拟合判断
- 生成 模型结果 + 指标解释
60 分钟版
- 批量处理 + 指标计算 + 质量报告
- 给出下一轮优化建议
考试实操 24:口头答辩题
- 本课“三大学习范式”任务的输入、输出分别是什么?
- 如果结果不达标,你会优先检查数据、规则、工具还是人员执行?为什么?
- 本次提交物如何证明可追溯?
- 在智慧图书馆项目中,哪些数据不能直接用于训练?
答辩时要结合样本编号和处理记录,不要只背概念。
考试实操 25:任务单
| 项目 | 要求 |
|---|---|
| 考核等级 | 四级/中级:数据处理、脚本辅助、模型训练与评估 |
| 业务场景 | 完成一个小型机器学习建模题 |
| 原始材料 | 特征表、标签列、训练/测试划分 |
| 限时要求 | 20 分钟完成小样本,40 分钟完成批量与质检 |
| 提交物 | 模型结果 + 指标解释 |
评分重点:过程可复现、结果可检查、异常有记录。
考试实操 26:样本表设计
| 样本编号 | 样本内容 | 处理要求 | 预期记录 |
|---|---|---|---|
| S01 | 三大学习范式样本A:标准、清晰、可直接处理 | 按标准流程处理 | 正常样本 |
| S02 | 三大学习范式样本B:边界情况,需要查规则 | 查阅规则后处理 | 边界说明 |
| S03 | 三大学习范式样本C:异常或争议,需记录原因 | 标记并提交复核 | 异常原因 |
要求:不得只写结论,必须写出判断依据或处理参数。
考试实操 27:小样本试跑
- 从材料中抽取 5 条代表样本:
三大学习范式样本A:标准、清晰、可直接处理、三大学习范式样本B:边界情况,需要查规则、三大学习范式样本C:异常或争议,需记录原因至少各覆盖 1 条。 - 先手工完成 2 条,确认“三大学习范式”的口径、字段、工具设置没有歧义。
- 再执行:围绕“三大学习范式”完成考试式实操:准备数据、执行处理、质检并交付。
- 将错例写入
error_cases.csv,字段包含:样本ID、错误类型、修正依据、复核人。
小样本试跑不过关,不进入批量处理。
考试实操 28:操作步骤
Step 1
读取题目材料:特征表、标签列、训练/测试划分。→Step 2
围绕“三大学习范式”完成考试式实操:准备数据、执行处理、质检并交付。→Step 3
提交:模型结果 + 指标解释。
禁止操作:临时改标签、覆盖原始文件、不记录异常、只提交截图不交数据。
考试实操 29:质量检查清单
- 原始数据已备份,处理文件另存为新版本
- “三大学习范式”相关规则已写入 README 或报告
- 至少抽检 10% 样本,且覆盖边界样本
- 指标检查:F1/AUC/RMSE、过拟合判断
- 所有异常样本都有编号、原因和处理意见
质检记录是考试给分点,不是可选项。
考试实操 30:错例分析
| 错误类型 | 本课常见表现 | 修正方法 |
|---|---|---|
| 口径错误 | “三大学习范式”判断标准前后不一致 | 回到规则表统一定义 |
| 格式错误 | 文件字段、编码、命名不符合要求 | 按模板重新导出 |
| 漏标漏处理 | 边界样本未进入复核 | 建立待确认列表 |
| 不可追溯 | 没有记录参数、版本或来源 | 补充处理日志 |
复盘要求:至少写 2 条错例及修正依据。
大学生学习拓展:模型训练基础:从数据到评估指标
本页为大学生培训增强内容:把本课知识连接到真实校园、科研与就业场景。
拓展 1
模型训练不是“跑起来”就结束,关键是理解训练集、损失、过拟合、指标和日志。
拓展 2
大学生应能解释准确率、召回率、F1、混淆矩阵等指标适用场景。
拓展 3
训练结果必须与业务目标对应,不能只看单一分数。
知识加餐:本课在AI项目中的位置
| 维度 | 大学生需要掌握 | AI训练师工作对应 |
|---|---|---|
| 概念 | 能用自己的话解释 三大学习范式 | 面向客户/团队讲清任务边界 |
| 操作 | 能完成一个最小可运行任务 | 形成可验收交付物 |
| 质量 | 能发现错误、记录问题、复核结果 | 支撑模型效果与责任追溯 |
| 合规 | 能说明数据来源、隐私与版权风险 | 满足项目审计和上线要求 |
课堂实训升级:从“听懂”到“做出来”
建议实训任务(四级/进阶)
- 训练一个简单文本分类模型,报告F1和混淆矩阵。
- 说明一次过拟合或欠拟合现象及修正办法。
交付物建议:数据文件 / 处理脚本 / 截图证据 / 1页说明 / 课堂展示。
工具链建议:国产模型 + 本地工具 + 可复现记录
数据与标注
Excel/WPS、Label Studio、CVAT、JSONL/CSV、抽样质检表。
模型与评估
Qwen、DeepSeek、BGE-M3、RAG、LoRA、F1/Recall/MRR等指标。
记录与展示
Jupyter、Markdown、Git/版本记录、PPT答辩、学习档案。
课堂讨论与课后反思
- 本课内容如果用于智慧图书馆,会服务哪个具体场景?
- 本课最容易出现的数据质量问题是什么?如何检查?
- 哪些数据不能直接进入训练或评估?为什么?
- 如何把本课成果放进个人作品集?
- 如果你是项目负责人,本课对应的验收指标是什么?