大模型这两年火得不行,微调是绕不开的词。但很多人连"推理"和"微调"都分不清,LoRA、SFT、RLHF这些名词更是一头雾水。这篇用大白话把大模型微调的基础讲清楚,搞懂这些概念,应付考试和面试都够用了。
一、先搞清推理和微调
先用最通俗的话把两个词分开。推理就是模型已经训好了,你把问题输进去,它吐出答案,模型本身一动不动。你平时跟ChatGPT聊天、用Qwen写东西,这个过程叫推理,不叫微调。它不学习,只是照本宣科。
微调不一样。微调是在一个已经预训练好的模型基础上,再拿一批特定数据继续训练,让它学会某个具体任务、某个行业的说话方式。模型的参数会被改动,变得更"懂行"。
为什么不从头训练一个新模型?因为太贵了。从头预训练要在海量文本上烧算力,几个亿都打不住,只有大厂玩得起。微调就便宜得多,拿现成模型改改,小团队也能干。这就是为啥现在都谈微调不谈预训练。
那预训练到底干了啥?预训练就是把互联网上海量文本喂给模型,让它学会语言规律、世界知识、基本推理能力。预训练出来的模型像个博学但不懂规矩的通才,啥都知道一点,但你问它啥它都瞎聊。微调就是教它规矩、让它专起来。
预训练还有个词叫底座模型,英文Base Model。这个底座是中立的,没经过对齐,你直接问它啥它都可能答得很放飞。我们日常用的聊天助手,都是在这种底座上又SFT又RLHF调教过的版本,叫对齐过的模型。这个"底座"和"对齐模型"的区别,考试可能提一嘴。
| 环节 | 模型动不动 | 花多少钱 |
|---|---|---|
| 推理 | 不动,只出答案 | 每次调用少量算力 |
| 微调 | 改参数,变专才 | 几千到几万条数据 |
记住这个区别:推理是"用",微调是"改"。你日常用模型问答是推理;想让它学会你们公司的业务、回答得更像人,才需要微调。很多人一上来就说要微调,其实他只是想让模型回答得更好,那多半调提示词就够了,根本不用微调。
还有个中间路子叫提示工程,也叫Prompt Engineering。不改模型,也不微调,就靠把输入提示词写得漂亮点,让推理效果变好。比如给模型定好角色、给几个示范、规定输出格式,它回答就靠谱多了。这种零成本见效快,能不微调就先别微调,省钱省时间。
什么时候才真得上微调?当提示词怎么写都达不到要求,或者要模型固定输出某种特定风格、特定领域知识,提示词撑不住了,这时候微调才派上用场。所以老手都是先试提示词,不行才微调,别本末倒置白花钱。
二、SFT和RLHF两步走
大模型变成能用的聊天助手,通常走两步:先SFT,再RLHF。这俩词考试和面试都爱提,得知道大概。
SFT全称监督微调,英文叫Supervised Fine-Tuning。说白了就是准备一堆"问题加标准答案"的例子,让模型照着学。你给它几千条"客户这么问,客服这么答",它学完就学会了客服的说话腔调。这一步最基础,也最常用。
SFT的数据从哪来?要么人工写,要么从现成对话里整理。质量比数量重要,几百条高质量的,比几万条垃圾数据管用。因为垃圾数据喂进去,模型就学歪了,越训越离谱。
RLHF全称基于人类反馈的强化学习。光有SFT还不够,模型答得对不对、好不好,人来打分。收集一堆人对模型回答的好坏评价,训一个奖励模型,再让大模型学着往高分方向靠。这一步让模型的回答更合人的口味,不是"技术上对"而是"人看着舒服"。
RLHF的典型用处:让模型别胡说八道、别教坏小孩、回答礼貌有条理。现在主流聊天助手都做过这一步。考试不会让你讲流程细节,知道"SFT是照着标准答案学,RLHF是靠人类打分教它做人"就够。
打个比方帮你记。SFT就像老师给标准答案让学生抄作业,学生照着写,学会了套路。RLHF就像学生写完作业老师批改,哪句写得好打个勾、哪句瞎写打个叉,学生慢慢摸清楚老师喜欢啥风格。一个是模仿标准答案,一个是根据反馈调整,顺序别搞反。
RLHF这步还有个产出叫奖励模型。你可以理解成一个"打分员"模型,它专门负责给大模型的回答打分,分高说明人喜欢、分低说明不行。大模型就照着这个打分员的喜好去优化。考试知道RLHF里有这么个"奖励模型"当裁判就行。
还有个比RLHF轻的思路叫DPO,直接用偏好数据训,省掉单独训奖励模型那一步。这是这两年的新做法,知道有这么个省事的替代就行,考试大概率不深究。
三、LoRA和QLoRA怎么省成本
微调有个老办法叫全参数微调,就是把模型所有参数都更新一遍。效果确实好,但太费钱。一个几十亿参数的模型,全量微调要好几张高端显卡,小公司扛不住。于是有了LoRA。
LoRA的思路很巧:原来那么多参数我一个都不动,冻结起来,只在旁边挂一小撮新参数来学。训练时只练这小撮,省下来的钱不是一星半点。效果跟全量微调差不了多少,所以现在几乎成了默认做法。
LoRA的好处还不止省钱。因为改动是独立挂上去的,你可以给同一个底座模型挂好几个LoRA,一个管客服、一个管写作、一个管代码,要用哪个挂哪个,像插件一样灵活。不用为每个任务重新存一个完整模型。
QLoRA是LoRA的进一步省钱版。它把模型原本的参数压缩成低精度存起来,再用LoRA训练。这么一来,一张普通消费级显卡就能微调大模型了。QLoRA出来之后,个人玩玩大模型微调才真的可行。
| 方法 | 改多少参数 | 显卡要求 |
|---|---|---|
| 全参数微调 | 全改 | 多张高端卡 |
| LoRA | 只改一小撮 | 专业卡够用 |
| QLoRA | 小撮加压缩 | 消费级卡也行 |
考试就爱问"LoRA为什么省成本"。你答:因为冻结了大部分参数,只训练很少一部分,显存和算力都省了,还能像插件一样随时换。这一句踩点就给分,别多扯。
这里得说句实在话。作为人工智能训练师,三级考试并不要求你真的上手写代码跑LoRA,它考的是你懂不懂这些概念、分得清推理和微调、知道数据该怎么准备。真要动手微调,那是算法工程师进阶的活。
但你别觉得概念没用。企业招训练师,最看重的就是你懂不懂这套流程、知不知道什么时候该微调什么时候该调提示词、能不能把数据整理明白。这些判断,恰恰是光会标注、不懂原理的人欠缺的。证书加实操经验,找工作才硬气。
四、数据准备和常见模型
微调这事,七成功夫在数据。你拿什么数据喂,模型就变成什么。SFT数据最常见的格式就是一问一答:用户说啥,理想回答是啥。把这些整理成规范格式,一条条喂进去。
数据准备有几个坑。一是格式要统一,别这条用这种格式那条用那种,模型学乱了。二是要去重,别把同一条喂一百遍。三是要对齐风格,你想要模型说话干练,例子就得干练;想要它客气,例子里就得客气。模型是照猫画虎,你给的例子啥样它就啥样。
现在常用的开源底座模型,考试可能提一嘴,你认个脸熟。Qwen是通义千问的开源版,中文表现好,国内用得最多;Llama是Meta出的,全球用得广;GLM是智谱的开源模型,中文也不错。这些模型免费可用,是大家做微调的常用底座。
选哪个底座?主要看三点:中文好不好、license让不让商用、你这张显卡跑得动不动。中文场景优先Qwen和GLM,社区资源多、踩坑资料好找。别一上来就追最新最大的模型,先拿小尺寸的练手,跑通了再放大。
数据量给个大概感觉。想让模型学会一个风格,SFT几百到几千条往往就有效果;想让它学扎实一个专业领域,几万条更稳。但再强调一次,别贪多,脏数据喂得越多模型越傻。宁可把两千条数据反复打磨干净,也别图省事丢两万条半成品进去。
微调完不是就完事了,得验收。拿一批没参与训练的测试问题问它,看回答对不对、风格对不对。如果它学歪了、还满嘴胡话,那不是模型不行,是数据有问题或者训过头了,回去查数据。这个"训完要测"的意识,比记住任何名词都重要。
很多人问学大模型微调有没有前途。直说:懂微调流程、会准备高质量数据的人,现在企业很缺,薪资也不低。但纯靠背概念不够,得有项目手感。优培东方就把这套从数据整理到LoRA微调的流程,拆成案例让你跟一遍,不是空讲理论。
优培东方背后是广州慧翔企业管理咨询有限公司,2011年成立,全国都有班,不是地方小机构。人工智能训练师这块,广州2380元、深圳3020元,考完领3120元补贴,两年学籍免费重学,七天无理由退费。
很多人担心零基础听不懂大模型。其实三级训练师考的是概念和流程,不考你写代码。你只要把推理、微调、SFT、LoRA这些名词的关系理顺,知道数据怎么准备,考试就够了。真要往算法走,那是进阶的事,一步一步来别着急。
想了解大模型方向怎么入行、报哪个班合适,打400-956-6153问,或上www.hxtdpx.com看课程大纲和最新开班。老师会根据你现在的基础,告诉你是先考训练师证还是直接上微调进阶课。
问题1:推理和微调有啥区别?
答1:推理是用现成模型出答案,参数不动;微调是拿数据继续训,改参数让模型变专才。
问题2:SFT和RLHF分别干啥?
答2:SFT照着标准答案学说话,RLHF靠人类打分让回答更合人胃口。
问题3:LoRA为什么省钱?
答3:冻结大部分参数,只训一小撮新参数,显存算力都省,还能像插件随时换。
问题4:常见开源模型有哪几个?
答4:Qwen、Llama、GLM,中文场景优先Qwen和GLM。
首页>


粤公安备案 44010602008731号