大模型应用落地:从 Demo 到生产的 10 个坑
把 LLM 应用从演示原型推向生产环境时,工程上最常踩的十个坑,以及每个坑的应对思路。
Read in English过去两年,我见过太多 LLM 项目“Demo 惊艳、生产翻车”。不是模型不行,而是团队把做 Demo 的思维方式直接搬进了生产。这篇文章总结从原型到生产最常踩的十个坑。
1. 把 Demo 当成产品
Demo 只用几个精心挑选的样例,提示词写死、上下文固定。生产环境输入千变万化,样例之外的输入立刻露馅。应对:从第一天就建立“长尾输入”样本集,把最差情况当验收标准。
2. 把幻觉当成 bug
幻觉不是 bug,是 LLM 的系统性特征。不做事实核查就上线,等于把错误输出直接给用户。应对:关键事实走检索增强(RAG)并标注来源,高影响场景加规则校验或人工兜底。
3. 没有延迟预算
LLM 单次调用 300ms 到数秒不等,多轮 Agent 可能累积到分钟级。传统接口的 P99 经验在这里全部失效。应对:交互流程重新设计——异步化、流式输出、预生成,把等待藏进产品逻辑。
4. 成本模型缺失
Token 成本随调用量线性爆炸,一个没设上限的循环调用可能烧掉整月预算。应对:上线前按 QPS、上下文长度、重试率建成本模型,设熔断和预算告警。
5. 没有评估集
传统软件用单测,LLM 应用没有“断言”,不建评估集就没法回归。应对:建一个覆盖典型场景与边界场景的评估集,每次改提示词、换模型都跑一遍,把“感觉变好了”变成可量化指标。
6. 缺缓存与降级
第三方模型 API 会抖动、会限流、会挂。没有缓存和降级方案,一次上游故障就是一次线上事故。应对:结果缓存(按语义相似度)、降级到本地模型或固定回复,保证核心链路不白屏。
7. 忽略提示注入
把外部输入直接拼进提示词,等于把系统提示词交给用户。应对:输入输出双向过滤,敏感操作与工具调用做权限校验,LLM 输出一律视为不可信数据。
8. 上下文管理粗糙
上下文越长越贵越慢,无限制拼接很快击穿窗口。应对:按需截断、摘要压缩、检索只取相关片段,把上下文当作需要管理的资源。
9. 可观测性缺失
传统系统看错误率、延迟、CPU;LLM 系统要看 token 消耗、上下文长度、重试率,更重要的是“回答质量”信号。应对:全链路打点 + 用户反馈回流,让质量问题可追踪、可复盘。
10. 组织问题被低估
AI 项目排期按普通 CRUD 估,交付标准不明确,验收全靠感觉。应对:把“评估集达标”作为验收红线,明确 AI 与传统逻辑的分工边界,让团队对不确定性有共识。
小结
LLM 应用的生产化,本质上是一场工程化的补课。模型能力越强,越要回到延迟、成本、可观测性这些老问题上去较真。避开上面十个坑,你的项目才算真正开始。