EN

AI

大模型应用落地:从 Demo 到生产的 10 个坑

把 LLM 应用从演示原型推向生产环境时,工程上最常踩的十个坑,以及每个坑的应对思路。

#LLM#工程化#RAG
Read in English

过去两年,我见过太多 LLM 项目“Demo 惊艳、生产翻车”。不是模型不行,而是团队把做 Demo 的思维方式直接搬进了生产。这篇文章总结从原型到生产最常踩的十个坑。

1. 把 Demo 当成产品

Demo 只用几个精心挑选的样例,提示词写死、上下文固定。生产环境输入千变万化,样例之外的输入立刻露馅。应对:从第一天就建立“长尾输入”样本集,把最差情况当验收标准。

2. 把幻觉当成 bug

幻觉不是 bug,是 LLM 的系统性特征。不做事实核查就上线,等于把错误输出直接给用户。应对:关键事实走检索增强(RAG)并标注来源,高影响场景加规则校验或人工兜底。

3. 没有延迟预算

LLM 单次调用 300ms 到数秒不等,多轮 Agent 可能累积到分钟级。传统接口的 P99 经验在这里全部失效。应对:交互流程重新设计——异步化、流式输出、预生成,把等待藏进产品逻辑。

4. 成本模型缺失

Token 成本随调用量线性爆炸,一个没设上限的循环调用可能烧掉整月预算。应对:上线前按 QPS、上下文长度、重试率建成本模型,设熔断和预算告警。

5. 没有评估集

传统软件用单测,LLM 应用没有“断言”,不建评估集就没法回归。应对:建一个覆盖典型场景与边界场景的评估集,每次改提示词、换模型都跑一遍,把“感觉变好了”变成可量化指标。

6. 缺缓存与降级

第三方模型 API 会抖动、会限流、会挂。没有缓存和降级方案,一次上游故障就是一次线上事故。应对:结果缓存(按语义相似度)、降级到本地模型或固定回复,保证核心链路不白屏。

7. 忽略提示注入

把外部输入直接拼进提示词,等于把系统提示词交给用户。应对:输入输出双向过滤,敏感操作与工具调用做权限校验,LLM 输出一律视为不可信数据。

8. 上下文管理粗糙

上下文越长越贵越慢,无限制拼接很快击穿窗口。应对:按需截断、摘要压缩、检索只取相关片段,把上下文当作需要管理的资源。

9. 可观测性缺失

传统系统看错误率、延迟、CPU;LLM 系统要看 token 消耗、上下文长度、重试率,更重要的是“回答质量”信号。应对:全链路打点 + 用户反馈回流,让质量问题可追踪、可复盘。

10. 组织问题被低估

AI 项目排期按普通 CRUD 估,交付标准不明确,验收全靠感觉。应对:把“评估集达标”作为验收红线,明确 AI 与传统逻辑的分工边界,让团队对不确定性有共识。

小结

LLM 应用的生产化,本质上是一场工程化的补课。模型能力越强,越要回到延迟、成本、可观测性这些老问题上去较真。避开上面十个坑,你的项目才算真正开始。