全部题目
共 115 道,按章分组。
第 1 章 · LLM 与 Prompt 基础15 题
Q1-01
Token 是什么?为什么说上下文窗口是大模型应用的第一约束?
Q1-02
大模型是怎么生成下一个字的?自回归生成和 KV Cache 是什么关系?
Q1-03
temperature 和 top_p 分别在调什么?什么场景调低、什么场景调高?
Q1-04
system prompt 和 user prompt 有什么区别?为什么指令要放 system?
Q1-05
大模型为什么会幻觉?应用层能做哪些缓解?
Q1-06
Embedding 是什么?为什么语义相近的两句话向量距离就近?
Q1-07
推理模型(thinking 类)和普通模型有什么区别?什么任务值得用?
Q1-08
说说你常用的 Prompt 技巧;few-shot 什么时候有效、什么时候反而有害?
Q1-09
CoT 为什么有效?推理模型时代还需要手写 CoT 吗?
Q1-10
怎么让模型稳定输出合法 JSON?结构化输出的几种实现与兜底策略?
Q1-11
什么是上下文工程?它和提示词工程是什么关系?
Q1-12
什么是 context rot?为什么上下文越长模型反而变笨?
Q1-13
多轮历史越来越长你怎么压缩?compaction 时什么必须保真?
Q1-14
Prompt 缓存是什么原理?怎么设计 prompt 才能「缓存友好」?
Q1-15
什么是提示词注入?你的应用怎么防?
第 2 章 · RAG 工程化25 题
Q2-01
完整讲一遍 RAG 链路:从文档进来到答案出去,每一步在解决什么问题?
Q2-02
有了百万级长上下文,为什么还要 RAG?「RAG 已死」你怎么看?
Q2-03
Chunking 粒度怎么定?固定切分会出什么问题?
Q2-04
什么是语义切分?重叠窗口、按标题层级切分各解决什么问题?
Q2-05
表格、代码、扫描件这类「脏文档」怎么处理进 RAG?
Q2-06
Embedding 模型怎么选?看哪些指标?维度越大越好吗?
Q2-07
HNSW 是怎么做近似最近邻的?相比暴力检索牺牲了什么?
Q2-08
Milvus / Chroma / pgvector / Elasticsearch 怎么选?
Q2-09
为什么纯向量检索会漏召回?什么 query 天生适合 BM25?
Q2-10
混合检索里 BM25 和向量的分数怎么融合?为什么很多团队直接用 RRF?
Q2-11
Rerank 是什么?有了向量检索为什么还要重排?
Q2-12
双塔和交叉编码器的区别?为什么不直接用 cross-encoder 检索全库?
Q2-13
用户 query 很口语很含糊,怎么做查询改写?HyDE 的思路是什么?
Q2-14
多数据源(向量库 / SQL / 图谱 / API)的检索路由怎么设计?
Q2-15
RAG 的召回率怎么评估?测试集从哪来?
Q2-16
RAGAS 这类框架评的是什么?faithfulness 和 answer relevancy 有何区别?
Q2-17
用户说「答非所问」,你怎么归因是检索问题还是生成问题?
Q2-18
说一个你处理过的最难的 RAG badcase
Q2-19
什么是 Agentic RAG?和固定管线比强在哪、贵在哪?
Q2-20
GraphRAG 解决什么问题?什么场景值得付出数倍索引成本?
Q2-21
LightRAG 相比微软 GraphRAG 轻在哪?
Q2-22
多模态 RAG(图表、PDF 截图检索)是怎么做的?
Q2-23
知识库更新了,向量索引怎么增量更新?删除的文档怎么办?
Q2-24
引用溯源怎么实现?怎么防模型「标了引用却胡编」?
Q2-25
给你一个新场景,怎么决定用 Naive / Advanced / Agentic / Graph 哪种架构?
第 3 章 · Agent 开发25 题
Q3-01
什么是 Agent?和 workflow、和「调用一次大模型」的本质区别?
Q3-02
什么时候该用 workflow,什么时候该上 Agent?盲目上 Agent 会踩什么坑?
Q3-03
Function Calling 的完整机制——模型真的「调用」函数了吗?
Q3-04
工具的 schema 和描述怎么设计,模型才能选得准、填得对?
Q3-05
并行工具调用什么时候用?工具结果太长塞爆上下文怎么办?
Q3-06
手写一个最小 ReAct 循环:退出条件和死循环兜底怎么设计?
Q3-07
ReAct、Plan-and-Execute、Reflection 三种范式的区别与选型?
Q3-08
MCP 是什么?它和 Function Calling 是什么关系、解决了 FC 的什么问题?
Q3-09
MCP 的三大原语(Tools / Resources / Prompts)分别干什么?
Q3-10
接入第三方 MCP Server 有什么安全风险?工具投毒、越权怎么防?
Q3-11
A2A 协议解决什么问题?和 MCP 是竞争还是互补?
Q3-12
Agent 的记忆系统怎么设计?短期、长期记忆分别放哪?
Q3-13
上下文快满了:滑动窗口 / 摘要压缩 / 重要性过滤怎么选?压缩丢了关键决定怎么办?
Q3-14
跨会话记忆怎么做?记忆检索和 RAG 是一回事吗?
Q3-15
多 Agent 有哪些编排模式?orchestrator-workers 适合什么场景?
Q3-16
多 Agent 一定比单 Agent 好吗?什么时候反而是灾难?
Q3-17
LangGraph / OpenAI Agents SDK / ADK / CrewAI 怎么选?为什么不少团队最后自己写循环?
Q3-18
Agent 跑偏或幻觉了怎么办?护栏在架构里放哪几层?
Q3-19
什么是分级自治?高危操作(写库 / 发邮件 / 付款)怎么设计人工确认?
Q3-20
什么是 Harness 治理?为什么说 Agent 的能力一半在模型一半在 harness?
Q3-21
Agent 怎么评测?只看最终结果不看轨迹会漏掉什么?
Q3-22
Agent 的 trace 怎么做?出了问题怎么定位是哪一步错的?
Q3-23
Agent 每轮都调大模型,太贵太慢,成本和延迟怎么优化?
Q3-24
Agent Skills 是什么?和把说明全写进 system prompt 有什么区别?渐进式披露解决什么?
Q3-25
从零设计一个能查库存、能下单的电商客服 Agent,讲讲整体架构
第 4 章 · 微调与对齐12 题
Q4-01
SFT、RLHF、DPO 分别在做什么?用一条主线把后训练串起来
Q4-02
DPO 为什么能绕开奖励模型?和 RLHF/PPO 比有什么取舍?
Q4-03
GRPO 是什么?为什么推理模型训练里常见?
Q4-04
LoRA 的原理是什么?为什么加两个低秩矩阵就能微调?
Q4-05
LoRA 的 r 和 alpha 怎么设?QLoRA 又省在哪?
Q4-06
微调 7B 模型,全参和 LoRA 各要多少显存?怎么估算?
Q4-07
什么问题该微调、什么问题该 RAG、什么问题写好 prompt 就够了?
Q4-08
基座模型半年一大版,你去年微调的模型还有价值吗?微调的护城河在哪?
Q4-09
微调数据从哪来?怎么保证质量?多少条够?
Q4-10
什么是蒸馏?用大模型造数据训小模型要注意什么(含合规)?
Q4-11
微调后"学会了新任务但变笨了"怎么办?
Q4-12
你简历里那次微调,效果提升怎么量化的?和 few-shot 基线比过吗?
第 5 章 · 评测与可观测10 题
Q5-01
AI 应用上线前怎么评测?评测集怎么建、多少条起步?
Q5-02
离线评测分很高,上线效果差——可能出了什么问题?
Q5-03
LLM-as-Judge 是什么?它自己有哪些偏差?怎么校准?
Q5-04
主观任务(文案 / 对话质量)怎么评?人工评测怎么设计才靠谱?
Q5-05
Agent 的轨迹评估和单轮问答评估有什么不同?
Q5-06
一次多轮 Agent 请求的 trace 里应该记哪些东西?
Q5-07
线上怎么发现质量回退?没有标准答案的场景怎么定监控指标?
Q5-08
换了新模型 / 新 prompt,怎么科学地做回归测试和 A/B?
Q5-09
用户点赞点踩怎么用起来,形成数据飞轮?
Q5-10
印象最深的一次线上质量事故,怎么定位和修的?
第 6 章 · 部署与成本10 题
Q6-01
直接调 API 和自建开源模型推理,这笔账怎么算?
Q6-02
vLLM 为什么快?PagedAttention、continuous batching 解决什么?
Q6-03
KV Cache 是什么?为什么长上下文推理显存爆炸?
Q6-04
流式输出怎么实现?SSE 和 WebSocket 怎么选?
Q6-05
实时语音链路怎么搭?级联 ASR→LLM→TTS 和端到端语音模型的取舍?
Q6-06
什么是 LLM 网关?限流、降级、多模型路由怎么设计?
Q6-07
语义缓存是什么?什么场景省大钱、什么场景会答错话?
Q6-08
模型路由(简单问题走小模型)怎么判断「简单」?
Q6-09
应用 token 成本突然涨了 3 倍,怎么排查和治理?
Q6-10
高峰期上游 API 限流了,你的应用怎么优雅降级?