AI短剧制作全流程《人工智能训练师》Ai为什么要训练?5 大核心模块-零基础从 Python 和标注学起人工智能神经网络基本原理与算法
- 2026-10-08 10:16:21

| 1. AI 基础与行业认知 | ||
| 2. 数据处理与标注 | ||
| 3. 模型训练与调优 | ||
| 4. 大模型与交互调优 | ||
| 5. 系统运维与合规 |
人工智能训练师(三级/高级工·2026考试大纲)
执行依据:人社部《人工智能训练师国家职业技能标准(2021 版)》(编码 4-04-05-05),2026 全国统一沿用国标,无新版国标变更;广东 / 深圳考点执行本大纲
一、考试整体规则
科目 | 时长 | 满分 | 合格线 | 考试形式 | 题型 |
理论知识 | 90min | 100 | 60 | 机考 | 单选 60%+ 多选 25%+ 判断 15% |
实操技能 | 120min | 100 | 60 | 上机实操系统 | 项目实操、参数配置、数据方案设计、Python 简答编程 |
两科独立计分,双 60 分才算通过,单科合格成绩当期有效。
二、理论知识大纲(总分 100,五大模块分值占比)
模块 1:职业道德与法律法规(15%)
职业守则、AI 训练岗位职业道德规范、行业从业准则
《数据安全法》《个人信息保护法》《网络安全法》、知识产权、标注数据版权规范
用工规范、数据隐私合规、敏感信息分级管控规则
模块 2:AI 基础理论(10%)
机器学习 / 深度学习基础:监督 / 无监督 / 强化学习、训练 / 验证 / 测试集划分逻辑
多模态基础:图像、文本、语音、视频数据特征与应用场景
Python 基础:基础语法、Numpy/Pandas 数据处理基础、常用第三方库
行业主流大模型基础知识、AI 落地行业应用(NLP、CV、ASR)
模块 3:业务需求与数据分析(20%)
垂类 AI 项目需求拆解、业务目标拆解、数据需求文档编写
数据源筛选、数据可行性评估、采集方案设计
数据质量评价指标(完整性、一致性、准确率、噪声率)、异常数据分析
项目成本、标注工时测算、项目落地风险分析
模块 4:智能数据处理与标注工程(30%【理论最高占比】)
全流程数据预处理:去重、降噪、缺值填充、格式标准化
多模态标注规范设计:实体抽取、OCR、关键点、语义分割、语音转写标注规则定制
主流工具:LabelStudio、Labelme、Doccano、开源标注平台部署基础
标注质检体系:抽检规则、错标漏标溯源、标注员绩效考核方案
数据集版本管理、数据分仓管理规范
模块 5:模型训练、调优与系统运维(25%)
数据集配比、超参基础(学习率、batch、epoch)、参数调试原理
模型评估指标:精确率 P、召回率 R、F1、mAP、准确率 ACC 指标释义
模型劣化、过拟合 / 欠拟合成因与优化方案、数据迭代优化思路
人机交互评测、AI 产品落地效果监控、线上问题数据回流方案
三、实操技能考核大纲(120min 上机,5 大实操项目,总分 100)
项目 1:业务方案设计(25 分)
给定行业场景(电商 NLP / 安防图像 / 智能语音任选其一),编写项目数据方案文档:需求拆解→数据源规划→标注规范初稿→质量管控方案。
项目 2:多模态数据清洗 + 标注规范落地(30 分,核心大题)
原始脏数据集(文本 / 图像二选一):用 Python(Pandas)批量清洗去噪、剔除异常数据
自定义标注规则,在标注软件完成批量标注 + 自检抽检
项目 3:数据集划分与模型参数配置(22 分)
按 7:2:1 拆分训练 / 验证 / 测试数据集
配置基础训练超参数,根据指标(F1/mAP)调整参数、写出调优理由
项目 4:模型效果诊断与优化方案(15 分)
给出模型劣化测试报告,定位过拟合 / 数据分布失衡问题,从数据层面 + 参数层面输出优化落地步骤。
项目 5:标注团队管控设计(8 分)
设计小团队标注任务分配、质检抽检制度、错误复盘流程。
四、2026 深圳 / 广东报考准入条件(满足其一)
本职业 / 相关岗位累计从业满10 年;
持有人工智能训练师四级证书 + 在岗满 4 年;
相关专业大专及以上学历 + 从业满 3 年;
初级职称 + 本行业从业满 1 年。
五、2026 新增考核侧重点(相较往年)
大模型微调配套数据制作:SFT 微调数据集构造、Prompt 标注规范(理论 + 实操必考)
合规升级:隐私脱敏实操、敏感数据过滤规则落地
轻量化 Python 代码实操:批量数据处理简易脚本(不再纯选择题,上机写短代码)






《人工智能训练师》(三级/高级)考试内容主要分为理论知识和操作技能(实操)两大部分,满分均为100分,60分及格。结合2026年最新考试趋势,其核心学习重点如下:
一、 理论知识考试重点(侧重综合理论与业务分析)
- 1.职业道德与法律法规:职业道德规范、人工智能伦理(如算法公平、隐私保护、可控可信)、相关法律法规(如《个人信息保护法》《数据安全法》)。
- 2.人工智能基础理论:机器学习与深度学习原理(神经网络、损失函数、优化算法)、大模型基础(Transformer架构、Prompt工程、大模型微调原理)。
- 3.业务分析:业务流程设计、业务模块效果优化、业务需求拆解与AI指标转化、业务场景AI可行性分析。
- 4.智能训练理论:数据处理规范制定、算法测试与评估指标(准确率、召回率、F1值、均方误差等)、模型调优理论(过拟合/欠拟合识别与优化策略)。
- 5.智能系统设计理论:智能系统监控与优化、人机交互流程设计、系统架构与交互设计原则。
- 6.培训与指导理论:培训讲义编写、初级人员指导方法。
二、 操作技能(实操)考试重点(侧重方案设计与综合应用)
- 1.业务分析实操:业务流程设计、业务模块效果优化(问题分析与优化方案设计)。
- 2.智能训练实操:数据处理规范制定(数据清洗、标注规范制定、质量校验)、算法测试(模型训练、超参数调优、模型评估、测试报告撰写)。
- 3.智能系统设计实操:智能系统监控与优化(数据拆解、系统性能优化)、人机交互流程设计(交互原型设计、交互流程优化)。
- 4.培训与指导实操:培训大纲编写、数据采集/处理/标注指导方案设计。
三、 核心考点与技能要求
- 方案设计能力:能够独立制定从数据采集、处理、模型训练到测试的完整方案,具备全链路设计思维。
- 模型调优能力:能够根据模型评估结果进行参数调优,解决模型过拟合/欠拟合等实际问题。
- 业务结合能力:能够将业务目标转化为AI训练指标,从业务视角评估模型效果,提出优化方案。
- 工具应用能力:熟练使用数据处理工具(如Python、Pandas、Numpy)、机器学习框架(如Scikit-learn、PyTorch)及标注工具。
注:考试题型以单选题、多选题、判断题(理论)和机考实操题(方案设计、案例分析、代码/工具操作)为主,备考时需注重理论与实践的结合。





一、神经网络:是由神经元组成,理论上可以逼近拟合任何复杂的函数。单个神经元只做简单的运算,实现输入数据的线性组合,然后再对计算结果做非线性运算。
二、数据样本采集:通过实验或模拟收集数据,定义期望的输入输出。神经网络通过训练逐步逼近所定义的函数。因此,神经网络的算法不是设计出来的,而是从数据中自动拟合出来的。
三、构建输入数据集:在有限时间内,通过实验或观测和记录输入数据和输出的结果。据此设计一个三层神经网络。

第一层为输入层包含三个数据变量(变量数量也可以为几千或上亿x1-xn),每输入三个变量经过神经网络都会得到0~1 之间数值。这三个数输入传递给给第二层隐藏层的四个神经元,计算得到四个结果。这四个结果再输入给第三层输出层的唯一神经元(可输出多个神经元),最后输出一个 0~1 之间的数值。采用如下函数表达神经网络:

神经网络只是定义了一个模型框架。在这个框架下,不同输入数据会得到不同的结果。对于一个复杂的神经网络来说,结构往往比单个神经元更重要。假设x1=0.8, x2=0.3, x3=0.7 实际测试输出的结果为0.6。为了获其他输入数据所得到的结果,这三个变量分别与自己对应的权重 w1,w2,w3 相乘再求和。求和大于 0,就输出这个数;如果和小于等于 0,则输出 0。那么如何确定权重?
在神经网络中,权重是依附于神经元的可训练参数,是通过循环学习输入数据来确定的,这个过程就称为训练。将线性运算(加减乘除)与非线性运算(比如 max或其他高阶函数)组合作为隐藏层的运算单元可以拟合任何复杂的函数。
那么神经网络训练是如何实现?这是 AI实现的核心。其中一种常用的训练算法——反向传播是一种训练神经网络的重要方法。就以上问题来进行反向传播的模型训练。
四、 反向传播训练模型:输入是三个维度的值,输出一个结果。训练调整神经网络的所有参数,让输入数据经过隐藏层的函数处理后得到预期的输出。要想了解训练算法的原理,简化求解过程,隐藏层只用一个神经元,如下图所示。

神经元的输入箭头上的权重和参数如下:

首先,给权重赋予一个初始值,比如让 w1=w2=w3=1。这个初始值可以是任意的,不会影响最终训练的结果。根据前面的公式计算出神经元的损失函数如下:

输出1.8的结果距离期望的 0.6 差得远,接下来调整权重,让输出更接近 0.6。为了实现这个目标,对损失函数的三个权重 w1, w2, w3 求偏导。

为了保证 loss 为正数和三个权重变量存在关联采用差值的平方计算,损失函数必然存在一个最小值 0。最终优化逼近的输出结果要尽可能地等于 0.6。
在训练模型时始终注意在 w1, w2, w3 在三个方向上的梯度,即偏导数值。令函数分别对 w1,w2,w3 求导,导数的反方向就是函数值下降的方向。求导的过程会用到复合函数的链式求导法则。反向传播就是直接用历史 w1,w2,w3 减去它们的导数值,即往导数相反的方向行进。新的 w1,w2,w3 为:

其中,α=0.1 被称为学习率,是控制梯度步长的常数。步长不能太大,太大就会丢失精度和数据,优化是一个小步长迭代的过程。

第一次训练发现新的 w1,w2,w3 让输出结果比原来的1.8更接近 0.6 了。接下来再从头开始循环训练,直到更新的 w1,w2,w3 计算得到与0.6相近。

《人工智能训练师》职业技能等级证书考试学习
理论考试测试题库
单选题
1.图灵测试是图灵在( )年在论文中《计算机与智能》中提出的。
A.1956
B.1950
C.1946
D.1940
正确答案:B
2.机器学习不包括( )。
A.监督学习
B.强化学习
C.非监督学习
D.群体学习
正确答案:D
3.AI的诞生是在( )。
A.1956年
B.1950年
C.1957年
D.1958年
正确答案:A
4.不是人工智能的三大学派的是( )。
A.符号学派
B.连接学派
C.行为学派
D.统计学派
正确答案:D
5.专家系统是( )学派的成果。
A.符号学派
B.连接学派
C.行为学派
D.统计学派
正确答案:A
6.神经网络是( )学派的成果。
A.符号学派
B.连接学派
C.行为学派
D.统计学派
正确答案:B
7.人工智能是指( )。
A.自然智能
B.人的智能
C.机器智能
D.通用智能
正确答案:C
8.通过一组符号及其组合来描述事物的是( )。
A.数据
B.信息
C.知识
D.文字
正确答案:A
9.人工智能的目的是让机器能够( ),以实现某些脑力劳动的机械化。
A.具有智能
B.和人一样工作
C.完全代替人的大脑
D.模拟、延伸和扩展人的智能
正确答案:D
10.下列关于人工智能的叙述不正确的是( )。
A.人工智能技术它与其他科学技术相结合极大地提高了应用技术的智能化水平。
B.人工智能是科学技术发展的趋势。
C.因为人工智能的系统研究是从上世纪五十年代才开始的,非常新,所以十分重要。
D.人工智能有力地促进了社会的发展。
正确答案:C

11.人工智能研究的一项基本内容是机器感知。以下列( )不属于机器感知的领域。
A.使机器具有视觉、听觉、触觉、味觉、嗅觉等感知能力。
B.让机器具有理解文字的能力。
C.使机器具有能够获取新知识、学习新技巧的能力。
D.使机器具有听懂人类语言的能力
正确答案:C
12.尽管人工智能学术界出现“百家争鸣”的局面,但当前国际人工智能的主流派仍属于:( )。
A.连接主义
B.符号主义
C.行为主义
D.经验主义
正确答案:B
13.被誉为国际“人工智能之父”的是( )。
A.图灵(Turing)
B.费根鲍姆(Feigenbaum)
C.傅京孙(K.S.Fu)
D.尼尔逊(Nilsson)
正确答案:A
14.下列哪个不是人工智能的研究领域( )。
A.机器证明
B.模式识别
C.人工生命
D.编译原理
正确答案:D
15.为了解决如何模拟人类的感性思维,例如视觉理解、直觉思维、悟性等,研究者找到一个重要的信息处理的机制是( )。
A.专家系统
B.人工神经网络
C.模式识别
D.智能代理
正确答案:B
16.下列哪个不是人工智能的研究领域( )。
A.机器证明
B.模式识别
C.人工生命
D.编译原理
正确答案:D
17.1997年5月12日,轰动全球的人机大战中,“更深的蓝”战胜了国际象棋之子卡斯帕罗夫,这是( )。
A.人工思维
B.机器思维
C.人工智能
D.机器智能
正确答案:C
18.自然语言理解是人工智能的重要应用领域,下面列举中的( )不是它要实现的目标。
A.理解别人讲的话
B.对自然语言表示的信息进行分析概括或编辑
C.自动程序设计
D.机器翻译
正确答案:C
19.盲人看不到一切物体,他们可以通过辨别人的声音识别人,这是智能的( )方面。
A.行为能力
B.感知能力
C.思维能力
D.学习能力
正确答案:B
20.人工智能的发展历程可以划分为( )。
A.诞生期和成长期
B.形成期和发展期
C.初期和中期
D.初级阶段和高级阶段
正确答案:B
21.机器人之父是指:( )。
A.阿兰.图灵
B.伯纳斯.李
C.莎佩克
D.英格伯格和德沃尔
正确答案:D
22.机器翻译属于下列哪个领域的应用( )。
A.自然语言系统
B.机器学习
C.专家系统
D.人类感官模拟
正确答案:A
23.智能机器人可以根据( )得到信息。
A.思维能力
B.行为能力
C.感知能力
D.学习能力
正确答案:C
24.自动识别系统属于人工智能哪个应用领域( )。
A.自然语言系统
B.机器学习
C.专家系统
D.人类感官模拟
正确答案:D
25.不是人工神经网络特点和优越性的表现的是( )。
A.自学习功能
B.自动识别功能
C.高速寻找优化解的能力
D.联想存储功能
正确答案:B
26.语音识别、语义理解、语音合成、OCR 识别、人脸识别等都属于人工智能技术,以下哪种事物没有应用到人工智能技术( )。
A.机器猫
B.无人机
C.微信客服
D.哈利波特的扫帚
正确答案:D
27.以下哪项功能不包含在环形麦克风阵列技术中( )。
A.语音降噪
B.回声消除
C.语音合成
D.声源定向
正确答案:C
28.以下技术中,不属于人工智能技术的是( )。
A.自动计算,通过编程计算 456*457*458*459 的值
B.文字识别,如通过 OCR 快速获得的图像中出汉字,保存为文本
C.语音输入,通过话筒将讲话内容转成文本
D.麦克风阵列,如利用灵云该技术实现远场语音交互的电视
正确答案:A
29.目前,语音识别技术已经进入人们生活的方方面面,以下人工智能应用场景中,( )没有应用到语音识别技术。
A.智能会议转写
B.智能外呼
C.语音质检分析
D.证照识别
正确答案:D
30.唤醒功能作为麦克风阵列技术中重要的一环,误唤醒率指标是低于( )次/天?
A.1 次
B.2 次
C.3 次
D.0.5 次
正确答案:A

点击转发分享给更多朋友学习知识~