搜索
题面、参考答案、追问链、教程小节与知识点都在索引里 —— 搜口语化问法(「两路召回怎么合并」)、 搜术语(「HNSW」)、或直接输题号(「Q2-10」)都能落到具体那一段。
全部题目115 道
第 1 章 · LLM 与 Prompt 基础
- Q1-01Token 是什么?为什么说上下文窗口是大模型应用的第一约束?
- Q1-02大模型是怎么生成下一个字的?自回归生成和 KV Cache 是什么关系?
- Q1-03temperature 和 top_p 分别在调什么?什么场景调低、什么场景调高?
- Q1-04system prompt 和 user prompt 有什么区别?为什么指令要放 system?
- Q1-05大模型为什么会幻觉?应用层能做哪些缓解?
- Q1-06Embedding 是什么?为什么语义相近的两句话向量距离就近?
- Q1-07推理模型(thinking 类)和普通模型有什么区别?什么任务值得用?
- Q1-08说说你常用的 Prompt 技巧;few-shot 什么时候有效、什么时候反而有害?
- Q1-09CoT 为什么有效?推理模型时代还需要手写 CoT 吗?
- Q1-10怎么让模型稳定输出合法 JSON?结构化输出的几种实现与兜底策略?
- Q1-11什么是上下文工程?它和提示词工程是什么关系?
- Q1-12什么是 context rot?为什么上下文越长模型反而变笨?
- Q1-13多轮历史越来越长你怎么压缩?compaction 时什么必须保真?
- Q1-14Prompt 缓存是什么原理?怎么设计 prompt 才能「缓存友好」?
- Q1-15什么是提示词注入?你的应用怎么防?
第 2 章 · RAG 工程化
- Q2-01完整讲一遍 RAG 链路:从文档进来到答案出去,每一步在解决什么问题?
- Q2-02有了百万级长上下文,为什么还要 RAG?「RAG 已死」你怎么看?
- Q2-03Chunking 粒度怎么定?固定切分会出什么问题?
- Q2-04什么是语义切分?重叠窗口、按标题层级切分各解决什么问题?
- Q2-05表格、代码、扫描件这类「脏文档」怎么处理进 RAG?
- Q2-06Embedding 模型怎么选?看哪些指标?维度越大越好吗?
- Q2-07HNSW 是怎么做近似最近邻的?相比暴力检索牺牲了什么?
- Q2-08Milvus / Chroma / pgvector / Elasticsearch 怎么选?
- Q2-09为什么纯向量检索会漏召回?什么 query 天生适合 BM25?
- Q2-10混合检索里 BM25 和向量的分数怎么融合?为什么很多团队直接用 RRF?
- Q2-11Rerank 是什么?有了向量检索为什么还要重排?
- Q2-12双塔和交叉编码器的区别?为什么不直接用 cross-encoder 检索全库?
- Q2-13用户 query 很口语很含糊,怎么做查询改写?HyDE 的思路是什么?
- Q2-14多数据源(向量库 / SQL / 图谱 / API)的检索路由怎么设计?
- Q2-15RAG 的召回率怎么评估?测试集从哪来?
- Q2-16RAGAS 这类框架评的是什么?faithfulness 和 answer relevancy 有何区别?
- Q2-17用户说「答非所问」,你怎么归因是检索问题还是生成问题?
- Q2-18说一个你处理过的最难的 RAG badcase
- Q2-19什么是 Agentic RAG?和固定管线比强在哪、贵在哪?
- Q2-20GraphRAG 解决什么问题?什么场景值得付出数倍索引成本?
- Q2-21LightRAG 相比微软 GraphRAG 轻在哪?
- Q2-22多模态 RAG(图表、PDF 截图检索)是怎么做的?
- Q2-23知识库更新了,向量索引怎么增量更新?删除的文档怎么办?
- Q2-24引用溯源怎么实现?怎么防模型「标了引用却胡编」?
- Q2-25给你一个新场景,怎么决定用 Naive / Advanced / Agentic / Graph 哪种架构?
第 3 章 · Agent 开发
- Q3-01什么是 Agent?和 workflow、和「调用一次大模型」的本质区别?
- Q3-02什么时候该用 workflow,什么时候该上 Agent?盲目上 Agent 会踩什么坑?
- Q3-03Function Calling 的完整机制——模型真的「调用」函数了吗?
- Q3-04工具的 schema 和描述怎么设计,模型才能选得准、填得对?
- Q3-05并行工具调用什么时候用?工具结果太长塞爆上下文怎么办?
- Q3-06手写一个最小 ReAct 循环:退出条件和死循环兜底怎么设计?
- Q3-07ReAct、Plan-and-Execute、Reflection 三种范式的区别与选型?
- Q3-08MCP 是什么?它和 Function Calling 是什么关系、解决了 FC 的什么问题?
- Q3-09MCP 的三大原语(Tools / Resources / Prompts)分别干什么?
- Q3-10接入第三方 MCP Server 有什么安全风险?工具投毒、越权怎么防?
- Q3-11A2A 协议解决什么问题?和 MCP 是竞争还是互补?
- Q3-12Agent 的记忆系统怎么设计?短期、长期记忆分别放哪?
- Q3-13上下文快满了:滑动窗口 / 摘要压缩 / 重要性过滤怎么选?压缩丢了关键决定怎么办?
- Q3-14跨会话记忆怎么做?记忆检索和 RAG 是一回事吗?
- Q3-15多 Agent 有哪些编排模式?orchestrator-workers 适合什么场景?
- Q3-16多 Agent 一定比单 Agent 好吗?什么时候反而是灾难?
- Q3-17LangGraph / OpenAI Agents SDK / ADK / CrewAI 怎么选?为什么不少团队最后自己写循环?
- Q3-18Agent 跑偏或幻觉了怎么办?护栏在架构里放哪几层?
- Q3-19什么是分级自治?高危操作(写库 / 发邮件 / 付款)怎么设计人工确认?
- Q3-20什么是 Harness 治理?为什么说 Agent 的能力一半在模型一半在 harness?
- Q3-21Agent 怎么评测?只看最终结果不看轨迹会漏掉什么?
- Q3-22Agent 的 trace 怎么做?出了问题怎么定位是哪一步错的?
- Q3-23Agent 每轮都调大模型,太贵太慢,成本和延迟怎么优化?
- Q3-24Agent Skills 是什么?和把说明全写进 system prompt 有什么区别?渐进式披露解决什么?
- Q3-25从零设计一个能查库存、能下单的电商客服 Agent,讲讲整体架构
第 4 章 · 微调与对齐
- Q4-01SFT、RLHF、DPO 分别在做什么?用一条主线把后训练串起来
- Q4-02DPO 为什么能绕开奖励模型?和 RLHF/PPO 比有什么取舍?
- Q4-03GRPO 是什么?为什么推理模型训练里常见?
- Q4-04LoRA 的原理是什么?为什么加两个低秩矩阵就能微调?
- Q4-05LoRA 的 r 和 alpha 怎么设?QLoRA 又省在哪?
- Q4-06微调 7B 模型,全参和 LoRA 各要多少显存?怎么估算?
- Q4-07什么问题该微调、什么问题该 RAG、什么问题写好 prompt 就够了?
- Q4-08基座模型半年一大版,你去年微调的模型还有价值吗?微调的护城河在哪?
- Q4-09微调数据从哪来?怎么保证质量?多少条够?
- Q4-10什么是蒸馏?用大模型造数据训小模型要注意什么(含合规)?
- Q4-11微调后"学会了新任务但变笨了"怎么办?
- Q4-12你简历里那次微调,效果提升怎么量化的?和 few-shot 基线比过吗?
第 5 章 · 评测与可观测
- Q5-01AI 应用上线前怎么评测?评测集怎么建、多少条起步?
- Q5-02离线评测分很高,上线效果差——可能出了什么问题?
- Q5-03LLM-as-Judge 是什么?它自己有哪些偏差?怎么校准?
- Q5-04主观任务(文案 / 对话质量)怎么评?人工评测怎么设计才靠谱?
- Q5-05Agent 的轨迹评估和单轮问答评估有什么不同?
- Q5-06一次多轮 Agent 请求的 trace 里应该记哪些东西?
- Q5-07线上怎么发现质量回退?没有标准答案的场景怎么定监控指标?
- Q5-08换了新模型 / 新 prompt,怎么科学地做回归测试和 A/B?
- Q5-09用户点赞点踩怎么用起来,形成数据飞轮?
- Q5-10印象最深的一次线上质量事故,怎么定位和修的?
第 6 章 · 部署与成本
- Q6-01直接调 API 和自建开源模型推理,这笔账怎么算?
- Q6-02vLLM 为什么快?PagedAttention、continuous batching 解决什么?
- Q6-03KV Cache 是什么?为什么长上下文推理显存爆炸?
- Q6-04流式输出怎么实现?SSE 和 WebSocket 怎么选?
- Q6-05实时语音链路怎么搭?级联 ASR→LLM→TTS 和端到端语音模型的取舍?
- Q6-06什么是 LLM 网关?限流、降级、多模型路由怎么设计?
- Q6-07语义缓存是什么?什么场景省大钱、什么场景会答错话?
- Q6-08模型路由(简单问题走小模型)怎么判断「简单」?
- Q6-09应用 token 成本突然涨了 3 倍,怎么排查和治理?
- Q6-10高峰期上游 API 限流了,你的应用怎么优雅降级?
全部教程47 篇
模块 0 · 大模型基础
模块 1 · Prompt 与上下文工程
模块 2 · RAG 工程化
模块 3 · Agent 开发
- T3-1Agent 与 Workflow 的边界——控制权归谁
- T3-2Function Calling 机制与工具设计——模型其实没有调用任何函数
- T3-3手写最小 ReAct 循环——退出条件才是真正的考点
- T3-4MCP 协议与 2026 无状态改版——从 M×N 到 M+N,再到能扛住负载均衡
- T3-5A2A 协议与 Agent 间通信——把对方当黑盒,而不是把对方的工具搬过来
- T3-6Agent 记忆系统与上下文压缩——被摘要掉的那条约束
- T3-7三种 Agent 范式的取舍——ReAct、Plan-and-Execute、Reflection
- T3-8多 Agent 编排——唯一正当的理由是上下文隔离
- T3-9Agent 框架选型——你在选的是"交出多少控制权"
- T3-10护栏、分级自治与 Harness 治理——能力的另一半不在模型里
- T3-11Agent 评测与 trace——它们会以"看起来成功"的方式失败
- T3-12成本与延迟优化 + Agent Skills——把"什么时候加载"变成架构变量
模块 4 · 微调与对齐
模块 6 · 部署与成本
全部知识点105 个
Agent 开发
- Agent 与 Workflow 的边界
- Workflow 还是 Agent:选型判据
- Agent 记忆系统
- 跨会话记忆与 RAG 的区别
- Function Calling 机制
- Agent 上下文管理与压缩策略
- 并行调用与工具结果治理
- 工具 schema 与描述设计
- MCP 协议:从 M×N 到 M+N
- ReAct 循环与退出条件
- Agent 成本与延迟优化
- Agent Skills 与渐进式披露
- A2A 协议与 Agent 间通信
- MCP 三大原语
- Agent 安全:工具投毒与越权
- 多 Agent 编排模式
- 护栏与可靠性
- Agent 框架选型
- Agent 评测:看轨迹而不只看结果
- Agent trace 与可观测性
- ReAct、Plan-and-Execute 与 Reflection
- 多 Agent 的取舍与典型死法
- 分级自治与人工确认
- Harness 治理