笃行
首页
个人 & 心法
互联网/硬件后台
游戏基础架构
UE 引擎
游戏业务
AI / 大模型
数据结构与算法
机器学习数学
通用基础
GitHub
首页
个人 & 心法
互联网/硬件后台
游戏基础架构
UE 引擎
游戏业务
AI / 大模型
数据结构与算法
机器学习数学
通用基础
GitHub
  • AI / 大模型

    • AI / 大模型
    • 大模型核心原理
    • 推理与微调优化
    • RAG 检索增强生成
    • RAG 上下文剪枝实战(Listwise Pruning 复现)
    • RAG 数据清理
    • RAG 存量数据清理
    • Agent 开发
    • Agent 运行时深水区
    • Multi-Agent 协作
    • Agent 评测与线上运营
    • AI 与游戏研发周期
    • 互动影游与长视频创作 Agent
    • LLM 应用安全
    • LLM 评测方法论
    • LLM 成本与延迟
    • 微调策略
    • AI 研发工程化

AI / 大模型

这一域覆盖大语言模型的核心原理与工程优化,以及基于 LLM 的应用开发(RAG、Agent)与研发工程化落地,共 17 个专题。

原理与优化

  • 大模型核心原理 —— Transformer / Self-Attention、位置编码、Tokenization、Scaling Law、解码采样、涌现与对齐
  • 推理与微调优化 —— KV Cache、FlashAttention、PagedAttention/vLLM、量化、投机解码、MoE、LoRA/QLoRA、RLHF/DPO、蒸馏
  • 微调策略选型 —— 全参 vs PEFT、SFT/RLHF/DPO 对比、何时该微调 vs 该用 RAG vs 该改 Prompt、灾难性遗忘

RAG 四篇(枢纽 → 深潜 → 运维)

  • RAG 检索增强生成 —— 检索链路、Chunking、向量索引、混合检索、Rerank、Query 改写、系统性提升召回率、评测与常见坑
  • RAG 上下文剪枝实战 —— Listwise LLM 剪枝复现:为什么固定 top-N 不行、自适应保留数、本地实测数字、分层归因与落地优化
  • RAG 数据清洗 —— 入库前的清洗与结构化,脏数据如何毁掉召回
  • RAG 存储与版本化 —— 向量库运维、增量更新、陈旧向量清理与版本切换

Agent 四篇(枢纽 → 运行时 → 多 Agent → 评测运营)

  • Agent 开发 —— 枢纽:Agent Loop、架构范式、工具调用协议、Prompt 杠杆、十大真实坑、框架对比
  • Agent 运行时深水区 —— 调度状态机与四条终止线、分层记忆读写时机与三种失效、压缩的时机与阶段、工具沙箱五道闸、并发/预算/幂等
  • Multi-Agent 协作 —— 五种协作拓扑 × 三层通信机制的对照矩阵、结果不一致的四级裁决阶梯、MAS 五种特有失效、任务分派与聚合、何时不该上 MAS
  • Agent 评测与线上运营 —— 四格评测矩阵、成功率口径与分母陷阱、轨迹级 judge、span 树归因、回放/影子/灰度与回滚判据

业务纵向轴

  • AI 与游戏研发周期 —— 研发效率视角:五阶段全景(立项/内容生产/QA/上线运营/数据迭代)+ 后台侧四处扎穿:AI 巡检、自动化测试断言、反外挂在线离线分工、客服 Agent 边界
  • 互动影游与长视频创作 Agent —— 内容生产主体视角:两类产物形态差异、六角色 DAG、四类长程一致性手段、分支爆炸与镜头并行、无 golden answer 的 rubric 评测

安全 · 评测 · 成本

  • LLM 应用安全 —— 提示注入(直接/间接/越狱)、工具与 RAG 场景下的注入放大、防护三板斧、信任边界
  • 评测方法论 —— 指标分类、基准污染、LLM-as-judge 可靠性与偏差校正、Golden Set、人类在环
  • 成本与延迟 —— Token 经济、TTFT vs TPOT、成本-质量-延迟三角、降本手段与预算护栏

工程化落地

  • AI 研发工程化 —— OpenSpec/Superpowers/CodeGraph/evomap 原理、Skill vs 经验演化、存量代码知识库与可复用组件的企业级选型

组织方式沿用全站五段式:场景问题 → 实现方案 → 为什么这么做 → 为什么别的选择不行 → 沉淀结论,每个专题至少配一段贴近真实的代码与一张流程图。

从你已知的后台概念出发

上面的清单按技术主题排。如果你是后台工程师,还有一条更省力的入口:从你已经熟悉的概念反查过去。

这一域的名词,绝大多数是你写过的机制换了个作用对象——缓存、索引、限流、幂等、状态机、可观测,一一都有对应物。下表只做映射与跳转,不解释含义;每个名词的完整解释(后台类比 + 它在系统里干什么 + 类比在哪失效)在各专题开头的 名词速查 小节里,点过去就能读到。

你已知的概念对应的 LLM 术语去哪读
缓存(Redis / 本地缓存 / CDN)KV Cache、prefix cache(缓存中间张量);语义缓存(缓存成品答案)推理与微调优化 · 名词速查 | 成本与延迟 · 名词速查
索引(跳表 / 倒排 / B+ 树)HNSW(跳表式分层图)、IVF-PQ(分桶+有损压缩)、BM25(倒排+TF-IDF)RAG · 名词速查
限流与配额(QPS 限流 / 熔断 / 配额)预算护栏(按 token 而非 QPS 计量)、预算熔断(耗尽要优雅收尾而非抛异常)成本与延迟 · 名词速查 | Agent 运行时深水区 · 名词速查
幂等工具调用幂等键(键必须由运行时算,不能让模型生成)Agent 运行时深水区 · 名词速查
状态机 / 工作流Agent 调度状态机、四条终止线、无进展判定Agent 运行时深水区 · 名词速查
可观测(Trace / span / APM)span 树(任务→轮→模型/工具)、步级归因、gen_ai.* 语义约定Agent 评测与线上运营 · 名词速查 | AI 研发工程化 · 名词速查
序列化 / 反序列化Tokenization / BPE(文本→id)、detokenize(id→文本,注意字符边界)大模型核心原理 · 名词速查 | 推理与微调优化 · 名词速查
分库分表 / 拆分键设计Chunking、chunk_size 与 overlap(整条链路最高杠杆的超参)RAG · 名词速查 | RAG 数据清理 · 名词速查
多路归并 / 加权排序混合检索、RRF(只按名次融合,绕开分数不可比)、Rerank 精排RAG · 名词速查
灰度与回滚回放 → 影子 → 灰度三级、人工接管率(比成功率更早暴露退化)Agent 评测与线上运营 · 名词速查
回归测试 / 断言Golden Set、评测四象限、格式遵从;创作类无标准答案时用 rubric 打分评测方法论 · 名词速查 | 创作 Agent · 名词速查
SQL 注入 / XSS直接注入、间接注入(存储型 XSS 的对应物)、越狱、信任边界LLM 应用安全 · 名词速查
容器隔离 / 最小权限工具沙箱、三级权限分级、凭据句柄(凭据绝不能进上下文)Agent 运行时深水区 · 名词速查
微服务拆分 / 分布式一致性协作拓扑、黑板(强一致走这条)、冲突消解四级阶梯、token O(N²)Multi-Agent 协作 · 名词速查
索引重建 / 蓝绿发布重嵌入、蓝绿双写、版本切换、陈旧向量清理RAG 存量清理 · 名词速查
打补丁 / 挂插件PEFT、LoRA / QLoRA(冻结主干只训低秩增量)微调策略选型 · 名词速查
代码索引 / SOP / 效能度量CodeGraph(三索引混合)、Skill vs 经验演化、采纳率/返工率/事故归因AI 研发工程化 · 名词速查

三个词在不同语境下不是一回事

context、memory、cache 在推理侧与 Agent / 成本侧含义不同,混淆会直接推出错误结论(比如"扩大上下文窗口就等于 Agent 记得更多"——不对)。两侧的对照消歧在这里:推理侧 ↔ Agent 侧 ↔ 成本侧。

最近更新: 2026/9/10 11:38
Next
大模型核心原理