全部题目

115 道,按章分组。

1 章 · LLM 与 Prompt 基础15

Q1-01
Token 是什么?为什么说上下文窗口是大模型应用的第一约束?
Token与上下文窗口高频
Q1-02
大模型是怎么生成下一个字的?自回归生成和 KV Cache 是什么关系?
生成机制常见
Q1-03
temperature 和 top_p 分别在调什么?什么场景调低、什么场景调高?
采样参数高频
Q1-04
system prompt 和 user prompt 有什么区别?为什么指令要放 system?
消息角色与对话结构高频
Q1-05
大模型为什么会幻觉?应用层能做哪些缓解?
幻觉高频
Q1-06
Embedding 是什么?为什么语义相近的两句话向量距离就近?
Embedding高频
Q1-07
推理模型(thinking 类)和普通模型有什么区别?什么任务值得用?
推理模型与思考档位高频新增
Q1-08
说说你常用的 Prompt 技巧;few-shot 什么时候有效、什么时候反而有害?
Prompt 模式高频
Q1-09
CoT 为什么有效?推理模型时代还需要手写 CoT 吗?
CoT 与推理常见新增
Q1-10
怎么让模型稳定输出合法 JSON?结构化输出的几种实现与兜底策略?
结构化输出高频
Q1-11
什么是上下文工程?它和提示词工程是什么关系?
上下文工程高频新增
Q1-12
什么是 context rot?为什么上下文越长模型反而变笨?
上下文工程高频新增
Q1-13
多轮历史越来越长你怎么压缩?compaction 时什么必须保真?
上下文压缩高频新增
Q1-14
Prompt 缓存是什么原理?怎么设计 prompt 才能「缓存友好」?
prompt 缓存常见新增
Q1-15
什么是提示词注入?你的应用怎么防?
安全高频

2 章 · RAG 工程化25

Q2-01
完整讲一遍 RAG 链路:从文档进来到答案出去,每一步在解决什么问题?
RAG 链路总览高频
Q2-02
有了百万级长上下文,为什么还要 RAG?「RAG 已死」你怎么看?
RAG 定位与长上下文高频
Q2-03
Chunking 粒度怎么定?固定切分会出什么问题?
Chunking高频
Q2-04
什么是语义切分?重叠窗口、按标题层级切分各解决什么问题?
Chunking 策略高频
Q2-05
表格、代码、扫描件这类「脏文档」怎么处理进 RAG?
文档解析常见
Q2-06
Embedding 模型怎么选?看哪些指标?维度越大越好吗?
Embedding 选型高频
Q2-07
HNSW 是怎么做近似最近邻的?相比暴力检索牺牲了什么?
向量索引常见
Q2-08
Milvus / Chroma / pgvector / Elasticsearch 怎么选?
向量库选型高频
Q2-09
为什么纯向量检索会漏召回?什么 query 天生适合 BM25?
检索策略高频
Q2-10
混合检索里 BM25 和向量的分数怎么融合?为什么很多团队直接用 RRF?
混合检索高频
Q2-11
Rerank 是什么?有了向量检索为什么还要重排?
Rerank高频
Q2-12
双塔和交叉编码器的区别?为什么不直接用 cross-encoder 检索全库?
检索模型架构常见
Q2-13
用户 query 很口语很含糊,怎么做查询改写?HyDE 的思路是什么?
查询理解常见
Q2-14
多数据源(向量库 / SQL / 图谱 / API)的检索路由怎么设计?
检索路由常见
Q2-15
RAG 的召回率怎么评估?测试集从哪来?
RAG 评测高频
Q2-16
RAGAS 这类框架评的是什么?faithfulness 和 answer relevancy 有何区别?
RAG 评测框架常见
Q2-17
用户说「答非所问」,你怎么归因是检索问题还是生成问题?
排障与归因高频
Q2-18
说一个你处理过的最难的 RAG badcase
项目经历深挖高频
Q2-19
什么是 Agentic RAG?和固定管线比强在哪、贵在哪?
Agentic RAG高频
Q2-20
GraphRAG 解决什么问题?什么场景值得付出数倍索引成本?
GraphRAG高频
Q2-21
LightRAG 相比微软 GraphRAG 轻在哪?
GraphRAG 变体进阶
Q2-22
多模态 RAG(图表、PDF 截图检索)是怎么做的?
多模态 RAG进阶
Q2-23
知识库更新了,向量索引怎么增量更新?删除的文档怎么办?
索引运维常见
Q2-24
引用溯源怎么实现?怎么防模型「标了引用却胡编」?
生成可信度常见
Q2-25
给你一个新场景,怎么决定用 Naive / Advanced / Agentic / Graph 哪种架构?
架构选型高频

3 章 · Agent 开发25

Q3-01
什么是 Agent?和 workflow、和「调用一次大模型」的本质区别?
Agent 定义与边界高频
Q3-02
什么时候该用 workflow,什么时候该上 Agent?盲目上 Agent 会踩什么坑?
架构选型高频
Q3-03
Function Calling 的完整机制——模型真的「调用」函数了吗?
工具调用机制高频
Q3-04
工具的 schema 和描述怎么设计,模型才能选得准、填得对?
工具设计高频
Q3-05
并行工具调用什么时候用?工具结果太长塞爆上下文怎么办?
工具调用工程常见
Q3-06
手写一个最小 ReAct 循环:退出条件和死循环兜底怎么设计?
ReAct 循环实现高频
Q3-07
ReAct、Plan-and-Execute、Reflection 三种范式的区别与选型?
Agent 范式高频
Q3-08
MCP 是什么?它和 Function Calling 是什么关系、解决了 FC 的什么问题?
MCP 协议高频
Q3-09
MCP 的三大原语(Tools / Resources / Prompts)分别干什么?
MCP 协议常见
Q3-10
接入第三方 MCP Server 有什么安全风险?工具投毒、越权怎么防?
Agent 安全高频
Q3-11
A2A 协议解决什么问题?和 MCP 是竞争还是互补?
A2A 协议常见
Q3-12
Agent 的记忆系统怎么设计?短期、长期记忆分别放哪?
记忆系统高频
Q3-13
上下文快满了:滑动窗口 / 摘要压缩 / 重要性过滤怎么选?压缩丢了关键决定怎么办?
上下文管理高频
Q3-14
跨会话记忆怎么做?记忆检索和 RAG 是一回事吗?
记忆系统常见
Q3-15
多 Agent 有哪些编排模式?orchestrator-workers 适合什么场景?
多 Agent 编排高频
Q3-16
多 Agent 一定比单 Agent 好吗?什么时候反而是灾难?
多 Agent 取舍高频
Q3-17
LangGraph / OpenAI Agents SDK / ADK / CrewAI 怎么选?为什么不少团队最后自己写循环?
框架选型高频
Q3-18
Agent 跑偏或幻觉了怎么办?护栏在架构里放哪几层?
护栏与可靠性高频
Q3-19
什么是分级自治?高危操作(写库 / 发邮件 / 付款)怎么设计人工确认?
分级自治高频
Q3-20
什么是 Harness 治理?为什么说 Agent 的能力一半在模型一半在 harness?
Harness 治理进阶
Q3-21
Agent 怎么评测?只看最终结果不看轨迹会漏掉什么?
Agent 评测高频
Q3-22
Agent 的 trace 怎么做?出了问题怎么定位是哪一步错的?
可观测性常见
Q3-23
Agent 每轮都调大模型,太贵太慢,成本和延迟怎么优化?
成本与延迟高频
Q3-24
Agent Skills 是什么?和把说明全写进 system prompt 有什么区别?渐进式披露解决什么?
Agent Skills常见
Q3-25
从零设计一个能查库存、能下单的电商客服 Agent,讲讲整体架构
综合设计高频

4 章 · 微调与对齐12

5 章 · 评测与可观测10

6 章 · 部署与成本10

7 章 · AI 编程协作8

8 章 · 场景设计题10