提示词的"降本"与"提准":2026 年主流大厂与顶尖高校方案全景
目录
- 提示词的"降本"与"提准":2026 年主流大厂与顶尖高校方案全景
- 引言:为什么这两条主线要一起谈
- 第一部分:提示词压缩(Prompt Compression)
- 1. 硬压缩(Hard Prompt Compression)
- 1.1 Selective Context(剑桥, EMNLP 2023)
- 1.2 LLMLingua 系列(Microsoft,EMNLP'23 / ACL'24)
- 1.3 Nano-Capsulator(Meta,2024)
- 1.4 BEAVER(2026 最新,训练无关分层压缩)
- 1.5 其他学术分支
- 2. 软压缩(Soft Prompt Compression)
- 2.1 Gisting(Stanford, Jesse Mu, NeurIPS 2023)
- 2.2 AutoCompressor(Princeton NLP, 2023)
- 2.3 ICAE / 500xCompressor(清华 THUDM, 2024)
- 2.4 xRAG(Microsoft, 2024)
- 3. 产品级方案:缓存优先(Cache-first)
- 4. Anthropic 的 "Context Engineering 四策略"(2025 正式化)
- 第二部分:准确率提升 + 幻觉抑制
- 1. 推理增强(Reasoning Enhancement)
- 1.1 Chain-of-Thought (CoT)(Google Brain, NeurIPS 2022)
- 1.2 Self-Consistency(Google + Stanford, ICLR 2023)
- 1.3 Tree-of-Thoughts (ToT)(Princeton + DeepMind, NeurIPS 2023)
- 1.4 Graph-of-Thoughts (GoT)(ETH Zurich, AAAI 2024)
- 1.5 Least-to-Most Prompting(Google, ICLR 2023)
- 2. 自我验证与幻觉治理(Verification & Hallucination Mitigation)
- 2.1 Chain-of-Verification (CoVe)(Meta AI, ACL Findings 2024)
- 2.2 Self-RAG(华盛顿大学 UW, ICLR 2024)
- 2.3 Semantic Entropy(牛津大学, Nature 2024 封面)
- 2.4 Self-Refine(CMU + Allen AI, NeurIPS 2023)
- 2.5 Reflexion(Northeastern + MIT, NeurIPS 2023)
- 2.6 Integrative Decoding(2025)
- 3. 检索增强(Retrieval-Augmented Methods)
- 3.1 RAG(Meta AI / Facebook, NeurIPS 2020)
- 3.2 HyDE — Hypothetical Document Embeddings(CMU, ACL 2023)
- 3.3 FLARE — Forward-Looking Active Retrieval(CMU, EMNLP 2023)
- 3.4 Corrective RAG (CRAG)(2024)
- 4. 自动化 Prompt 优化(Automated Prompt Optimization)
- 4.1 APE — Automatic Prompt Engineer(Toronto + Google, ICLR 2023)
- 4.2 OPRO — Optimization by PROmpting(Google DeepMind, ICLR 2024)
- 4.3 DSPy(Stanford, ICLR 2024)
- 4.4 PromptWizard(Microsoft Research, 2024)
- 4.5 TextGrad(Stanford, 2024)
- 第三部分:如何组合?—— 2026 年生产级最佳实践
- 场景 A:客服工单分类 / 结构化输出
- 场景 B:RAG 长文档问答
- 场景 C:多轮 Agent 长任务
- 一张综合对比表(速查用)
引言:为什么这两条主线要一起谈
在 2024–2026 年,业界对 LLM 的诉求从"跑通"进入"跑好且跑省"阶段,同时出现两个矛盾:
| 矛盾 | 表现 |
|---|---|
| 要塞更多上下文 | RAG、多轮 Agent、CoT 让 prompt 动辄 5k–50k tokens,成本与延迟爆炸 |
| 又要更少幻觉 | Prompt 越长越容易出现 “lost in the middle” 和事实性错误 |
Prompt 压缩解决"贵和慢",幻觉治理解决"错和飘"。两者看似方向相反,实则共享同一底层假设:"信息密度"比"token 数量"更重要。所以现代 LLM 工程栈里,两条主线越来越走向融合。
第一部分:提示词压缩(Prompt Compression)
按技术路径可分为三类:硬压缩(Hard,可读文本)、软压缩(Soft,Embedding 向量)、产品级缓存方案。