第 13 课:缺失值识别与处理
第 13 课 缺失值识别与处理 A2数据采集与整理 · 五级/初级工 北二外海棠 AI 实验室 课时:2 学时 · 特色场景:智慧图书馆/多语种数据 1. 为什么学习本课? AI 训练师的工作不是“点按钮”,而是把业务问题转化为可训练、可评估、可交付的数据和模型任务。 本课聚焦 缺失值识别与处理,解决真实项目中的三个问题: 1. 概念边界不清; 2. 操作流…
第 13 课 缺失值识别与处理
A2_数据采集与整理 · 五级/初级工
北二外海棠 AI 实验室
课时:2 学时 · 特色场景:智慧图书馆/多语种数据
1. 为什么学习本课?
- AI 训练师的工作不是“点按钮”,而是把业务问题转化为可训练、可评估、可交付的数据和模型任务。
- 本课聚焦
缺失值识别与处理,解决真实项目中的三个问题:
1. 概念边界不清;
2. 操作流程不稳;
3. 交付标准不明确。
学习目标:课后能说清概念、完成基础操作,并产出可检查的任务交付物。
2. 学习目标
| 目标层级 | 学员应达到的表现 |
|---|---|
| 知识理解 | 能解释 缺失值识别与处理 的定义、适用场景与常见误区 |
| 操作技能 | 能按步骤完成一个小型任务,并保存过程记录 |
| 质量意识 | 能用检查清单发现错误、返工点和合规风险 |
| 场景迁移 | 能迁移到图书馆咨询、多语种文本、科研数据等场景 |
3. 课前导入案例
案例:智慧图书馆 AI 咨询项目
读者提出问题:
我想查“一带一路”相关阿语文献,有没有中文综述和英文高被引论文?AI 训练师需要判断:
- 需要哪些数据?
- 如何标注或清洗?
- 如何评估模型回答是否可靠?
- 如何记录隐私、版权和数据来源?
4. 核心概念
| 概念 | 简明解释 | 训练师关注点 |
|---|---|---|
| 数据对象 | 被采集、标注、清洗或训练的数据单元 | 来源、格式、授权、质量 |
| 标签/特征 | 模型学习所依赖的结构化信息 | 标签体系是否一致 |
| 训练反馈 | 模型或质检返回的问题信号 | 是否形成闭环改进 |
| 交付物 | 项目结束时可验收的文件和报告 | 可复现、可审计、可复查 |
5. 标准工作流程
- 明确任务:确认业务目标、数据范围、验收指标。
- 准备数据:采集、清洗、脱敏、抽样。
- 执行操作:标注/处理/训练/评估。
- 质量检查:抽检、复核、一致性或指标计算。
- 记录交付:保存数据、脚本、报告、问题清单。
6. 工具与方法
| 工具/方法 | 适用场景 | 本课要求 |
|---|---|---|
| Excel/WPS | 小规模数据整理 | 能筛选、去重、记录问题 |
| Label Studio/CVAT | 标注任务 | 能理解项目配置与导出格式 |
| Python/Jupyter | 批处理和分析 | 能运行教师提供的示例脚本 |
| 文档模板 | 项目记录和汇报 | 能按模板填写完整信息 |
7. 动手实操
任务:完成一个 20 条样例数据的小型处理任务。
步骤:
- 读取教师提供的样例数据;
- 按本课规则处理或标注;
- 随机抽检 5 条;
- 记录 2 个最容易出错的地方;
- 提交数据文件和 1 页说明。
8. 北二外特色迁移
将 缺失值识别与处理 迁移到三类场景:
| 场景 | 示例任务 | 产出 |
|---|---|---|
| 多语种教学 | 中英阿文本清洗/标注 | 平行语料或标签文件 |
| 智慧图书馆 | 读者咨询 FAQ 结构化 | 意图标签、知识库条目 |
| AI科研训练 | 文献摘要、关键词、方法抽取 | 综述矩阵、证据表 |
9. 随堂测验
缺失值识别与处理最核心的概念是什么?- 本课流程中哪一步最容易影响数据质量?
- 如果两名标注员意见不一致,应如何处理?
- 哪些数据必须脱敏后才能进入训练集?
- 如何判断本课任务是否达到交付标准?
10. 常见错误与纠正
| 常见错误 | 后果 | 纠正方法 |
|---|---|---|
| 不记录数据来源 | 无法审计与复现 | 建立来源登记表 |
| 标签定义模糊 | 一致性下降 | 增加正例、反例、边界例 |
| 只看完成数量 | 忽视质量 | 同时统计准确率、完整率、返工率 |
| 忽视合规 | 产生隐私/版权风险 | 脱敏、授权、最小必要原则 |
11. 课后作业
提交以下材料:
- 处理后的样例数据文件;
- 任务过程记录表;
- 质量自检表;
- 100 字反思:本课方法如何用于智慧图书馆或多语种数据项目?
12. 评分标准
| 维度 | 分值 | 标准 |
|---|---|---|
| 完整性 | 30 | 是否完成全部步骤与交付文件 |
| 准确性 | 30 | 标注/处理结果是否符合规范 |
| 规范性 | 20 | 文件命名、格式、记录是否清晰 |
| 反思迁移 | 20 | 是否能联系真实 AI 训练师岗位 |
大学生学习拓展:大学生数据素养:从采集到可训练数据集
本页为大学生培训增强内容:把本课知识连接到真实校园、科研与就业场景。
拓展 1
训练数据不是“收集得越多越好”,而是要来源可靠、格式统一、授权清晰、质量可查。
拓展 2
大学生应掌握CSV/JSON、去重、缺失值、数据划分和版本管理等基础能力。
拓展 3
数据采集要遵守版权、隐私、最小必要和可追溯原则。
知识加餐:本课在AI项目中的位置
| 维度 | 大学生需要掌握 | AI训练师工作对应 |
|---|---|---|
| 概念 | 能用自己的话解释 缺失值识别与处理 | 面向客户/团队讲清任务边界 |
| 操作 | 能完成一个最小可运行任务 | 形成可验收交付物 |
| 质量 | 能发现错误、记录问题、复核结果 | 支撑模型效果与责任追溯 |
| 合规 | 能说明数据来源、隐私与版权风险 | 满足项目审计和上线要求 |
课堂实训升级:从“听懂”到“做出来”
建议实训任务(五级/基础)
- 整理20条校园问答数据,完成去重、字段规范化和训练/验证/测试划分。
- 写一页数据来源与合规说明。
交付物建议:数据文件 / 处理脚本 / 截图证据 / 1页说明 / 课堂展示。
工具链建议:国产模型 + 本地工具 + 可复现记录
数据与标注
Excel/WPS、Label Studio、CVAT、JSONL/CSV、抽样质检表。
模型与评估
Qwen、DeepSeek、BGE-M3、RAG、LoRA、F1/Recall/MRR等指标。
记录与展示
Jupyter、Markdown、Git/版本记录、PPT答辩、学习档案。
课堂讨论与课后反思
- 本课内容如果用于智慧图书馆,会服务哪个具体场景?
- 本课最容易出现的数据质量问题是什么?如何检查?
- 哪些数据不能直接进入训练或评估?为什么?
- 如何把本课成果放进个人作品集?
- 如果你是项目负责人,本课对应的验收指标是什么?