本文要点
- 三种路线解决的是不同问题:提示词解决"怎么说",知识库解决"知道什么",微调解决"怎么判断"
- 用四条判断线定位需求,可以避免把知识更新问题误当成微调问题
- 微调的前置条件是高质量样本和评测集,不是数据量
- 实际项目里三种路线通常是组合使用,而不是三选一
"我们要不要微调一个自己的模型?"这是企业做 AI 时最常见的问题之一。但这个问题本身问早了——先要判断的是:你要解决的问题,真的需要微调吗?
微调、知识库、提示词这三条路线经常被放在一起比较,但它们并不在同一个层面上竞争。分清楚各自解决什么,选型就简单很多。
三种路线分别解决什么问题
| 路线 | 本质 | 解决什么问题 | 典型表现 |
|---|---|---|---|
| 提示词工程 | 通过指令约束模型的输出方式 | 回答的语气、格式、角色、流程 | 成本低、见效快,但不改变模型的固有知识 |
| 知识库(RAG) | 检索企业资料后交给模型作答 | 模型不知道企业自己的信息 | 知识可随时更新,回答可追溯到原文 |
| 微调 | 用企业样本继续训练模型 | 模型需要形成稳定的专业判断或表达风格 | 周期长、要求高,但能稳定产出企业专属能力 |
一句话概括:提示词解决"怎么说",知识库解决"知道什么",微调解决"怎么判断"。
很多被当成微调需求的问题,其实是知识库问题。比如"模型不知道我们的产品参数"是知识问题;"模型不懂我们行业的术语习惯"可能是提示词问题;而"模型写的方案不符合我们内部的技术评审逻辑",这才可能触及微调。
四条判断线
第一条:问题是知识缺失,还是能力缺失?
如果答案是"模型不知道我们公司的信息",先建知识库。企业知识的更新频率通常很高,把它写进模型权重里是一种浪费——每次更新都要重新训练。知识库让内容保持可维护,改一份文档就能生效。
第二条:问题是表达不一致,还是判断不稳定?
如果只是回答语气、格式、称谓不统一,用提示词加模板就能解决大部分。只有当模型需要在专业场景下反复做出符合企业标准的判断(例如风险评估口径、技术方案取舍逻辑),微调才值得投入。
第三条:你们有没有足够的"标准答案"?
微调需要的是成对样本:输入 + 符合企业标准的正确输出。这往往比想象中难得到。多数企业的真实情况是能凑出大量历史文档,但很难说清哪一份是"标准做法"。没有人能定义正确答案,就没有办法训练出稳定能力。
第四条:你们能不能判断微调后是变好了还是变差了?
这是最容易被忽略、也最关键的一条。没有评测集,微调就是在盲调。 至少需要准备一批有代表性、有人工判定的测试问题,用来对比微调前后的表现。评测集不只是验收工具,它在整个过程中都决定方向。
关于微调的三个常见误区
误区一:数据越多效果越好。 样本质量的作用远大于数量。几百条高质量、贴近真实业务场景的样本,通常比几万条格式混乱的历史文档更有效。低质量数据混进来,模型学到的会是错误模式。
误区二:微调之后就不用知识库了。 微调擅长固化的能力和风格,不擅长承载频繁变化的事实信息。产品参数、价格政策、活动规则这类内容,仍然应该放在知识库里。
误区三:微调可以解决幻觉。 恰恰相反,微调如果用了不准确的数据,会加重模型的自信错误。控制幻觉更有效的方式是知识库加引用约束——让模型基于检索到的资料回答,并给出出处。
实际项目里通常是组合使用
真实的企业 AI 应用很少是单一技术路线。一个典型的客服型应用可能是这样的结构:
- 用提示词定义角色、语气与回答边界;
- 用知识库提供产品资料、政策文件和历史工单;
- 如果企业有大量特定领域的判断逻辑,再用微调让模型形成稳定的处理方式。
分层的价值在于成本和可维护性:能用提示词解决的不建知识库,能用知识库解决的不做微调。 每往上一层,投入和维护成本都会明显增加。
建议的判断顺序
准备启动项目时,可以按这个顺序走一遍:
- 先明确要解决的具体业务问题,以及判断成败的指标;
- 判断这个问题的瓶颈是知识、表达还是判断能力;
- 优先尝试成本最低的路线,观察实际差距在哪里;
- 只有当低成本路线明确触到天花板时,再评估微调;
- 无论选哪条路线,都先准备一批可复用的评测问题。
这个顺序不追求一步到位,但能避免在早期把预算花在不必要的训练上。
如果你不确定自己遇到的问题属于哪一类,或者已经有过一次效果不理想的尝试,欢迎联系我们。绿鸟软件提供企业专属模型的定制与微调服务,会先帮你判断技术路线是否必要,再给出实施建议。