AI入门06|一个大模型,到底是怎么训练出来的?
前面讲过,大模型会通过预测下一个Token学习语言。
但一个今天可以正常聊天、推理和调用工具的大模型,并不是只做一次训练就结束。
可以把整个过程简单理解成几个阶段。
一、第一步:准备训练数据
训练数据可能来自:
网页、书籍、论文、代码、公开资料以及其他依法取得和处理的数据。
在真正训练之前,还需要进行大量:
清洗、去重、过滤和格式处理。
数据质量会直接影响模型质量。
二、第二步:预训练
Pre-training,预训练,是大模型形成通用能力的核心阶段。
模型不断看到大量文本,并尝试预测后续Token。
预测错误以后,训练算法调整内部参数。
这个过程重复极其庞大的次数。
最终,大量语言和知识模式被编码进模型参数。
三、模型不是把训练材料原样存进数据库
这是一个非常重要的区别。
训练完成后,模型主要保留下来的是大量参数和权重。
它不像一个硬盘:
“这里保存着第1本书、第2份合同、第3篇论文。”
因此大模型拥有广泛知识,并不意味着它是一个可以精确查询原文的数据库。
这也是为什么它可能知道一个法律原则,却把具体法条说错。
四、第三步:指令训练
只完成预训练的模型,更像一个很会继续写文字的“基础模型”。
但普通用户希望它能够:
回答问题、服从要求、总结文件、按照格式输出。
所以还需要进一步做指令训练,让它学会:
面对一个任务应该怎样响应。
五、第四步:人类反馈和对齐
模型还会通过人类反馈等方式继续调整。
例如比较不同回答:
哪个更有帮助;
哪个更符合要求;
哪个更安全。
你经常会看到RLHF等术语。
入门阶段不需要记住算法细节,只需要理解:
模型会在预训练之后继续被教成一个更适合与人协作的助手。
六、第五步:强化推理、代码、工具和多模态能力
现代模型还可能接受针对性的进一步训练,使它更擅长:
数学;
代码;
复杂推理;
图片和语音;
工具调用。
所以不同模型即使规模接近,能力特点也可能明显不同。
七、训练模型和建立知识库完全不同
如果你把1000份法律文件上传到知识库,通常并没有重新训练模型。
知识库只是让AI回答时可以去检索这些资料。
而训练是改变模型参数本身。
这是两个完全不同的概念。
八、每天聊天也通常不等于重新训练模型
AI产品可能通过:
聊天历史、记忆、项目上下文
让后续体验更连续。
但这不意味着每聊一次,背后的基础大模型就因为你而重新训练一次。
所以后面要逐渐区分:
训练、上下文、知识库、记忆。
九、可以用“培养新员工”做一个比喻
预训练像接受非常广泛的基础教育。
指令训练像学习怎么听懂工作要求。
后续对齐像学习组织的行为规范。
专业训练则像加强某些专项能力。
当然这只是方便理解的比喻。
十、这一篇只需要记住一句话
一个现代大模型通常经历大规模预训练,再通过指令、反馈、推理和工具等训练逐渐成为我们今天使用的AI助手;它学到的是模型参数中的模式,而不是建立了一个精确的原文数据库。
