AI / 大模型
这一域覆盖大语言模型的核心原理与工程优化,以及基于 LLM 的应用开发(RAG、Agent)与研发工程化落地,共 17 个专题。
原理与优化
- 大模型核心原理 —— Transformer / Self-Attention、位置编码、Tokenization、Scaling Law、解码采样、涌现与对齐
- 推理与微调优化 —— KV Cache、FlashAttention、PagedAttention/vLLM、量化、投机解码、MoE、LoRA/QLoRA、RLHF/DPO、蒸馏
- 微调策略选型 —— 全参 vs PEFT、SFT/RLHF/DPO 对比、何时该微调 vs 该用 RAG vs 该改 Prompt、灾难性遗忘
RAG 四篇(枢纽 → 深潜 → 运维)
- RAG 检索增强生成 —— 检索链路、Chunking、向量索引、混合检索、Rerank、Query 改写、系统性提升召回率、评测与常见坑
- RAG 上下文剪枝实战 —— Listwise LLM 剪枝复现:为什么固定 top-N 不行、自适应保留数、本地实测数字、分层归因与落地优化
- RAG 数据清洗 —— 入库前的清洗与结构化,脏数据如何毁掉召回
- RAG 存储与版本化 —— 向量库运维、增量更新、陈旧向量清理与版本切换
Agent 四篇(枢纽 → 运行时 → 多 Agent → 评测运营)
- Agent 开发 —— 枢纽:Agent Loop、架构范式、工具调用协议、Prompt 杠杆、十大真实坑、框架对比
- Agent 运行时深水区 —— 调度状态机与四条终止线、分层记忆读写时机与三种失效、压缩的时机与阶段、工具沙箱五道闸、并发/预算/幂等
- Multi-Agent 协作 —— 五种协作拓扑 × 三层通信机制的对照矩阵、结果不一致的四级裁决阶梯、MAS 五种特有失效、任务分派与聚合、何时不该上 MAS
- Agent 评测与线上运营 —— 四格评测矩阵、成功率口径与分母陷阱、轨迹级 judge、span 树归因、回放/影子/灰度与回滚判据
业务纵向轴
- AI 与游戏研发周期 —— 研发效率视角:五阶段全景(立项/内容生产/QA/上线运营/数据迭代)+ 后台侧四处扎穿:AI 巡检、自动化测试断言、反外挂在线离线分工、客服 Agent 边界
- 互动影游与长视频创作 Agent —— 内容生产主体视角:两类产物形态差异、六角色 DAG、四类长程一致性手段、分支爆炸与镜头并行、无 golden answer 的 rubric 评测
安全 · 评测 · 成本
- LLM 应用安全 —— 提示注入(直接/间接/越狱)、工具与 RAG 场景下的注入放大、防护三板斧、信任边界
- 评测方法论 —— 指标分类、基准污染、LLM-as-judge 可靠性与偏差校正、Golden Set、人类在环
- 成本与延迟 —— Token 经济、TTFT vs TPOT、成本-质量-延迟三角、降本手段与预算护栏
工程化落地
- AI 研发工程化 —— OpenSpec/Superpowers/CodeGraph/evomap 原理、Skill vs 经验演化、存量代码知识库与可复用组件的企业级选型
组织方式沿用全站五段式:场景问题 → 实现方案 → 为什么这么做 → 为什么别的选择不行 → 沉淀结论,每个专题至少配一段贴近真实的代码与一张流程图。
从你已知的后台概念出发
上面的清单按技术主题排。如果你是后台工程师,还有一条更省力的入口:从你已经熟悉的概念反查过去。
这一域的名词,绝大多数是你写过的机制换了个作用对象——缓存、索引、限流、幂等、状态机、可观测,一一都有对应物。下表只做映射与跳转,不解释含义;每个名词的完整解释(后台类比 + 它在系统里干什么 + 类比在哪失效)在各专题开头的 名词速查 小节里,点过去就能读到。
| 你已知的概念 | 对应的 LLM 术语 | 去哪读 |
|---|---|---|
| 缓存(Redis / 本地缓存 / CDN) | KV Cache、prefix cache(缓存中间张量);语义缓存(缓存成品答案) | 推理与微调优化 · 名词速查 | 成本与延迟 · 名词速查 |
| 索引(跳表 / 倒排 / B+ 树) | HNSW(跳表式分层图)、IVF-PQ(分桶+有损压缩)、BM25(倒排+TF-IDF) | RAG · 名词速查 |
| 限流与配额(QPS 限流 / 熔断 / 配额) | 预算护栏(按 token 而非 QPS 计量)、预算熔断(耗尽要优雅收尾而非抛异常) | 成本与延迟 · 名词速查 | Agent 运行时深水区 · 名词速查 |
| 幂等 | 工具调用幂等键(键必须由运行时算,不能让模型生成) | Agent 运行时深水区 · 名词速查 |
| 状态机 / 工作流 | Agent 调度状态机、四条终止线、无进展判定 | Agent 运行时深水区 · 名词速查 |
| 可观测(Trace / span / APM) | span 树(任务→轮→模型/工具)、步级归因、gen_ai.* 语义约定 | Agent 评测与线上运营 · 名词速查 | AI 研发工程化 · 名词速查 |
| 序列化 / 反序列化 | Tokenization / BPE(文本→id)、detokenize(id→文本,注意字符边界) | 大模型核心原理 · 名词速查 | 推理与微调优化 · 名词速查 |
| 分库分表 / 拆分键设计 | Chunking、chunk_size 与 overlap(整条链路最高杠杆的超参) | RAG · 名词速查 | RAG 数据清理 · 名词速查 |
| 多路归并 / 加权排序 | 混合检索、RRF(只按名次融合,绕开分数不可比)、Rerank 精排 | RAG · 名词速查 |
| 灰度与回滚 | 回放 → 影子 → 灰度三级、人工接管率(比成功率更早暴露退化) | Agent 评测与线上运营 · 名词速查 |
| 回归测试 / 断言 | Golden Set、评测四象限、格式遵从;创作类无标准答案时用 rubric 打分 | 评测方法论 · 名词速查 | 创作 Agent · 名词速查 |
| SQL 注入 / XSS | 直接注入、间接注入(存储型 XSS 的对应物)、越狱、信任边界 | LLM 应用安全 · 名词速查 |
| 容器隔离 / 最小权限 | 工具沙箱、三级权限分级、凭据句柄(凭据绝不能进上下文) | Agent 运行时深水区 · 名词速查 |
| 微服务拆分 / 分布式一致性 | 协作拓扑、黑板(强一致走这条)、冲突消解四级阶梯、token O(N²) | Multi-Agent 协作 · 名词速查 |
| 索引重建 / 蓝绿发布 | 重嵌入、蓝绿双写、版本切换、陈旧向量清理 | RAG 存量清理 · 名词速查 |
| 打补丁 / 挂插件 | PEFT、LoRA / QLoRA(冻结主干只训低秩增量) | 微调策略选型 · 名词速查 |
| 代码索引 / SOP / 效能度量 | CodeGraph(三索引混合)、Skill vs 经验演化、采纳率/返工率/事故归因 | AI 研发工程化 · 名词速查 |