本文要点

  • 三种路线解决的是不同问题:提示词解决"怎么说",知识库解决"知道什么",微调解决"怎么判断"
  • 用四条判断线定位需求,可以避免把知识更新问题误当成微调问题
  • 微调的前置条件是高质量样本和评测集,不是数据量
  • 实际项目里三种路线通常是组合使用,而不是三选一

"我们要不要微调一个自己的模型?"这是企业做 AI 时最常见的问题之一。但这个问题本身问早了——先要判断的是:你要解决的问题,真的需要微调吗?

微调、知识库、提示词这三条路线经常被放在一起比较,但它们并不在同一个层面上竞争。分清楚各自解决什么,选型就简单很多。

三种路线分别解决什么问题

路线 本质 解决什么问题 典型表现
提示词工程 通过指令约束模型的输出方式 回答的语气、格式、角色、流程 成本低、见效快,但不改变模型的固有知识
知识库(RAG) 检索企业资料后交给模型作答 模型不知道企业自己的信息 知识可随时更新,回答可追溯到原文
微调 用企业样本继续训练模型 模型需要形成稳定的专业判断或表达风格 周期长、要求高,但能稳定产出企业专属能力

一句话概括:提示词解决"怎么说",知识库解决"知道什么",微调解决"怎么判断"。

很多被当成微调需求的问题,其实是知识库问题。比如"模型不知道我们的产品参数"是知识问题;"模型不懂我们行业的术语习惯"可能是提示词问题;而"模型写的方案不符合我们内部的技术评审逻辑",这才可能触及微调。

四条判断线

第一条:问题是知识缺失,还是能力缺失?

如果答案是"模型不知道我们公司的信息",先建知识库。企业知识的更新频率通常很高,把它写进模型权重里是一种浪费——每次更新都要重新训练。知识库让内容保持可维护,改一份文档就能生效。

第二条:问题是表达不一致,还是判断不稳定?

如果只是回答语气、格式、称谓不统一,用提示词加模板就能解决大部分。只有当模型需要在专业场景下反复做出符合企业标准的判断(例如风险评估口径、技术方案取舍逻辑),微调才值得投入。

第三条:你们有没有足够的"标准答案"?

微调需要的是成对样本:输入 + 符合企业标准的正确输出。这往往比想象中难得到。多数企业的真实情况是能凑出大量历史文档,但很难说清哪一份是"标准做法"。没有人能定义正确答案,就没有办法训练出稳定能力。

第四条:你们能不能判断微调后是变好了还是变差了?

这是最容易被忽略、也最关键的一条。没有评测集,微调就是在盲调。 至少需要准备一批有代表性、有人工判定的测试问题,用来对比微调前后的表现。评测集不只是验收工具,它在整个过程中都决定方向。

关于微调的三个常见误区

误区一:数据越多效果越好。 样本质量的作用远大于数量。几百条高质量、贴近真实业务场景的样本,通常比几万条格式混乱的历史文档更有效。低质量数据混进来,模型学到的会是错误模式。

误区二:微调之后就不用知识库了。 微调擅长固化的能力和风格,不擅长承载频繁变化的事实信息。产品参数、价格政策、活动规则这类内容,仍然应该放在知识库里。

误区三:微调可以解决幻觉。 恰恰相反,微调如果用了不准确的数据,会加重模型的自信错误。控制幻觉更有效的方式是知识库加引用约束——让模型基于检索到的资料回答,并给出出处。

实际项目里通常是组合使用

真实的企业 AI 应用很少是单一技术路线。一个典型的客服型应用可能是这样的结构:

  1. 用提示词定义角色、语气与回答边界;
  2. 用知识库提供产品资料、政策文件和历史工单;
  3. 如果企业有大量特定领域的判断逻辑,再用微调让模型形成稳定的处理方式。

分层的价值在于成本和可维护性:能用提示词解决的不建知识库,能用知识库解决的不做微调。 每往上一层,投入和维护成本都会明显增加。

建议的判断顺序

准备启动项目时,可以按这个顺序走一遍:

  • 先明确要解决的具体业务问题,以及判断成败的指标;
  • 判断这个问题的瓶颈是知识、表达还是判断能力;
  • 优先尝试成本最低的路线,观察实际差距在哪里;
  • 只有当低成本路线明确触到天花板时,再评估微调;
  • 无论选哪条路线,都先准备一批可复用的评测问题。

这个顺序不追求一步到位,但能避免在早期把预算花在不必要的训练上。

如果你不确定自己遇到的问题属于哪一类,或者已经有过一次效果不理想的尝试,欢迎联系我们。绿鸟软件提供企业专属模型的定制与微调服务,会先帮你判断技术路线是否必要,再给出实施建议。

预约技术方案沟通