很多人一上手就想:“要不要把模型微调一下,让它更懂我?”其实大部分时候,先把提示词写明白就能解决八成问题。微调(Fine-tuning)和提示词工程(Prompt Engineering)不是二选一的死对头,而是不同成本、不同收益的两件工具。选错的一边,要么白烧钱,要么效果不到位。本文帮你按场景做决定。
两件事分别在改什么
提示词工程是在“提问”上做文章,不动模型权重,改起来快、零训练;微调是动模型本身,把某种风格或专长“腌”进参数里,慢但更贴。两者改的层级不同。
提示词工程是在“模型出厂不变”的前提下,靠你给的指令把活干好。它不改模型权重,只在每次对话里塞进合适的背景、格式和要求。微调则是拿一批你自己的样本,重新训练模型的一部分参数,让某些能力固化进模型本身。一个是临时叮嘱,一个是长期培训,差别就在这。
先用提示词工程的场景
如果你的问题靠“说清楚”就能解决,别急着微调。下面这些情况,提示词通常更划算。
- 任务格式固定:要它输出表格、JSON、固定模板,写清规则即可。
- 背景会经常变:今天按 A 政策答,明天按 B 政策答,写进提示比重训模型灵活。
- 样本还不够多:没有几百上千条高质量标注,微调容易过拟合还白忙。
- 想快速试错:改一句提示几秒钟,重训一轮要好几小时甚至更久。
提示词也不是随便写。把角色、任务、约束、示例、输出格式分开写,比一大段散文强得多。好的提示像一份清楚的工单,模型照着做就不容易跑偏。
该考虑微调的信号
当“怎么叮嘱都稳不住”或者“每次都要重复一大段背景”时,微调才有意义。
- 风格必须一致:比如品牌语气、特定术语用法,写提示总被它带跑,就固化进模型。
- 延迟和成本敏感:每次提示都要塞几千字背景,固化后请求变短,反而省钱。
- 特定能力难用提示表达:某些结构化判断,样本训练比文字描述更准。
判断口诀:能靠提示词稳定解决的,就别微调;提示词写到吐、还稳不住的,再上微调。
一张表帮你拍板
决策也很直接:先试提示词,够用就别动模型;如果提示词怎么调都不稳、且需求长期固定,再考虑微调。多数团队卡在“提示词没写透”就急着微调。
| 看这点 | 选提示词 | 选微调 |
|---|---|---|
| 改动频率 | 经常变 | 长期不变 |
| 样本量 | 几条就够 | 几百条以上 |
| 目标 | 控格式控背景 | 固风格固能力 |
| 成本 | 几乎为零 | 训练加维护 |
现实里更常见的是组合:用微调把模型的“底层习惯”定下来,再用提示词在每次对话里补最新的业务背景。两层配合,比单押一边稳。
新手最容易犯的错
- 一上来就微调:样本没凑齐就训,结果模型学会了你的错别字。
- 提示写得太散:背景、要求、示例搅成一团,模型抓不住重点。
- 不先建评测:改了提示或训完模型,却没一组固定题目验证好坏,全凭感觉。
小结:提示词工程是低门槛的第一选择,微调是高投入的进阶手段。先把手边的提示词写透,确认它真顶不住了,再谈训练。这样你的时间和算力都花在刀刃上,而不是花在“其实一句提示就能解决”的事上。
上线前必做的一组评测题
不管选哪条路,改完都要拿同一组题验证,不然全凭感觉。题目覆盖三类:常规任务看稳不稳定,边界输入看会不会崩,错误示范看它有没有识别出来。每次改提示或重训,都跑同一组,分数才有可比性。很多人忽略这一步,结果上线后发现好像没之前好了,却拿不出证据。评测题不用多,二三十道覆盖典型情况就够,关键是固定下来反复用。
混合用法的实战样子
举个常见组合:先用微调把模型的语气和术语固化,比如让它说话始终像你们品牌的客服;再用提示词在每次对话里塞进当天的活动规则和用户订单。模型底层习惯不用每次重说,最新背景又能随时换。这样训练和提示各管一层,维护成本反而比纯提示低。
- 微调层管怎么说:语气、术语、默认风格。
- 提示层管说什么:当天政策、用户上下文、输出格式。
- 两层都留评测:任一层改动都跑同一组题。
记住一句大白话:提示词解决这次怎么说对,微调解决以后都这么说。分清楚这两层,选型就不乱了。新手最容易把两层混在一起,既没把风格训进去,提示又写得像个长篇小说,两头都不讨好。
再讲个反例帮你避雷。有人花两周微调了个模型,只为让它回答时带产品链接,结果链接经常填错,因为微调记的是旧链接。其实在提示里写“回答末尾附上对应产品页链接,从下方清单取”就行,清单一更新提示跟着改,零训练成本。这类用提示就能钉死的事,硬上微调纯属折腾。把精力留给提示真顶不住的地方,才叫把钱花在刀刃上。
最后提醒一句预算账。提示词的边际成本几乎为零,你改一百次也就是时间。微调一上来是训练费加样本整理费,上线后还要有人维护样本、重训、回归测试。小团队资源紧,先把提示词榨干再考虑微调,是更稳的节奏。等量级上来、场景固定,微调的复利才显出来。别被训练才高级的错觉带偏,省钱又省心的那一步,往往就是先把提示写透。


