这篇学完你能回答什么
- 「给你一个新场景,从零设计一套方案」——这类开放题该按什么顺序讲?
- 为什么上来就画架构图的人分数最低?
- 面试官追问「预算砍一半」「日活涨一千倍」时,你的方案要怎么长得住?
从一个真实故障讲起
一家做工业设备的公司要做「售后手册问答」。技术负责人是从大厂出来的,方案定得很漂亮:文档进 GraphRAG 建实体关系图,检索层做 Agentic RAG 让模型自己决定查几轮,上面再挂一个多 Agent 编排——一个查手册、一个查工单历史、一个查备件库存,最后汇总。
做了三个月,上线两周后砍回去了。砍成什么样?BM25 + 向量的混合检索,加一个重排,加一句「找不到就说找不到」的提示词。 效果比原方案好,成本是原来的十七分之一。
复盘时最扎心的一句话来自客服主管:「我们的手册一共 400 篇,八成的问题集中在 30 篇里,而且都是『某某报警码是什么意思』。」
这个方案不是技术不好,是没人在开工前问过一句「不做这些的话,基线能到多少」。GraphRAG 解决的是跨文档多跳推理,这个场景里几乎没有多跳;Agentic RAG 解决的是查询复杂需要多轮探索,而这里八成是单跳查询;多 Agent 解决的是任务确实需要分工,而这里三个数据源根本不用同时查。
场景设计题考的就是这件事。 面试官不是想听你会多少种技术——2026 年这些概念的知晓率已经很高了,说得出名字不构成区分度。他想知道的是:你会不会先问清楚约束,会不会先给基线,会不会为每一样加挂说出代价。
接下场景
工业设备售后手册问答,手册 400 篇
跳过基线断点
没人问「不做这些能到多少」
直接上全家桶
GraphRAG + Agentic + 多 Agent
做了三个月
上线两周就被砍回去了
砍成最土的方案
混合检索 + 重排 + 找不到就说找不到
核心概念:先打比方,再给定义
比方:不是考你会做多少菜,是考你会不会点菜
一个厨师上来就说「我给您做佛跳墙」,听着厉害,但他没问过:几个人吃、预算多少、有没有忌口、多久要上桌。真正的高手第一句话是问的,不是答的。
场景设计题里的「问」有四类:规模(数据多大、日活多少、并发峰值)、质量底线(答错的代价是什么,是尴尬还是赔钱)、约束(数据能不能出网、有没有权限隔离要求、延迟上限)、演进(这是要验证想法还是要直接上生产)。
定义:五步答题结构
这是本项目从第 2 章沿用至今的固定骨架,第 8 章十道题全部复用它:
① 澄清需求 ─→ ② 给基线 ─→ ③ 加挂并说代价 ─→ ④ 谈评测 ─→ ⑤ 谈演进 问清约束 最土的方案 每加一样都要 怎么知道 什么信号 和成功标准 能到什么水平 答「代价是什么」 它变好了 出现才升级
它的本质是一个受约束优化问题的求解顺序:先确定约束(①),再找可行解(②),再在约束内做增量改进(③),再定义目标函数怎么测(④),最后规划迭代路径(⑤)。跳过任何一步,后面的话都悬空——没有约束就没有取舍,没有基线就没有增量,没有评测就没有「变好」。
开口就是佛跳墙,听着挺厉害
没问过几个人吃、预算多少、有没有忌口、多久要上桌
GraphRAG / Agentic 张口就来
2026 年这些名字的知晓率已经很高,说得出名字不构成区分度
第一句话是问的,不是答的
问完才知道这一桌该做什么,也知道什么可以不做
五步通法的第 ① 步,只花两分钟
问四类并且每个都带上「你为什么问」,否则听着像在拖延
原理拆解
第 ① 步 澄清需求:问四类问题,但只花两分钟
不要变成盘问。问四个问题就够,并且每个问题都要带上「你为什么问」,否则听起来像在拖延:
| 问什么 | 为什么问(一定要说出来) |
|---|---|
| 数据规模与更新频率 | 决定索引式还是检索式、要不要增量更新 |
| 答错的代价 | 决定「不知道就说不知道」的阈值和人工兜底的强度 |
| 数据出不出网、要不要权限隔离 | 决定能不能用公有云 API、隔离做在哪一层 |
| 现在有没有人在做、怎么做的 | 这条最值钱——现状就是你的基线 |
如果面试官说「你自己假设」,那就明确说出你的假设并继续,不要卡住。合格的表述是:「我按 10 万文档、日活 2000、答错只是效率损失不涉及资金来做,如果实际是金融场景我后面会改两处。」
第 ② 步 给基线:先说最土的方案能到什么水平
这一步是整道题的地基,也是最多人跳过的。基线的作用有三个:给增量一个参照物、给成本一个下限、给自己一个「什么时候可以停」的判据。
不同类型场景的典型基线:
文档问答类 → 切块 + 向量检索 + BM25 混合 + 重排 + 「找不到就说找不到」 任务执行类 → 写死的 workflow(if/else + 三五个工具),不上 Agent 数据查询类 → 预置 20 条常用查询模板 + 参数填充,不上 NL2SQL 生成类 → 一个好 prompt + 三个 few-shot,不微调
说基线时必须给一个数量级的预期,哪怕是估的:「这套东西在这类场景一般能到七成上下的可用率,剩下三成集中在表格、多跳和口语化查询。」有没有这句话,是「读过」和「做过」的分界。
第 ③ 步 加挂并说代价:本项目的三段式铁律
每加一样东西,必须同时说三件事——解决什么、代价是什么、什么时候不该用。这一条是项目的内容铁律,也是场景题里区分度最高的地方,因为它无法背诵,只能来自真实取舍。
选什么加挂,用三问决策树(骨架 A):
模型不知道这件事 → 挂 RAG(知识注入) 模型知道但不会按要求做 → 先提 effort 档位 + 改 prompt → 还不行才 SFT → 有可验证奖励再 RLVR 能做但太贵 / 太慢 → 蒸馏、路由、缓存
注意第二支的顺序:答得浅的第一动作是提档位,不是加提示词。这是本项目的冻结口径之一,2026 年仍然是高频分水岭。
第 ④ 步 谈评测:三条线 + 只在掉分时下沉
三条线(骨架 C)互相佐证、不互相替代:
- 离线评测集——决定「能不能发」;
- 线上采样——决定「发完有没有变坏」;
- 业务指标——终审,但滞后。
层级下沉顺序(骨架 E):先端到端,端到端掉分了才看轨迹级,轨迹级定位不了才拆到组件级。上来就做组件级评测是最常见的浪费——你会得到一堆很漂亮但和最终效果无关的分数。
再补两条本项目的冻结口径:零成本信号优先于 judge(转人工率、重问率、截断率、复制率最被低估);分数变化必须过统计关(n=100、基线 80% 时 95% 置信区间大约 ±7.8 个百分点,涨了 3 个点什么都说明不了)。
第 ⑤ 步 谈演进:给触发信号,不给时间表
弱回答是「一期做 RAG,二期做 Agent,三期做微调」——这是排期不是演进。强回答是给出升级的触发信号:
出现「一个问题要跨三四篇文档才能答」→ 才考虑图结构 出现「查询需要多轮试探才能定位」 → 才考虑 Agentic 检索 出现「同一类需求每天几万次且稳定」 → 才考虑蒸馏小模型 出现「人工兜底率长期高于 X%」 → 才考虑扩流程而不是扩模型
同时要说反向条件:什么情况下这套要退回去。会说退路的人,比只会说前进的人可信得多。
工程实践(截至 2026-08)
四张随身表
表一 · 三问决策树:不知道 → RAG;不会做 → 提档位 + prompt → SFT → RLVR;太贵太慢 → 蒸馏 / 路由 / 缓存。
表二 · 评测三条线 + 下沉顺序:离线集 / 线上采样 / 业务指标;端到端 → 轨迹级 → 组件级,只在上一级掉分时下沉。
表三 · 成本三刀 + 降本九步:
第一刀 切输入侧 / 输出侧 (输出贵 5–6 倍,思考 token 计在输出侧)
第二刀 切各侧内部 (输入侧看缓存命中与重复注入;输出侧看轮次与档位)
第三刀 才是单价 (且只有降两档才有意义)
九步顺序:精确缓存 → 前缀缓存 → 批处理 → 削工具结果 → 降 effort
→ 修命中率 → 路由 → 语义缓存 → 减功能顺序的逻辑是从「不影响正确性」走到「影响正确性」。前五步基本不动效果,第六步之后开始有代价,最后一步是承认做不到。要补一条 2026 的新陷阱:有的新模型换了 tokenizer,同样文本的 token 数会明显变多——单价降三成、token 涨三成,账单没降。
表四 · 四道闸(骨架 J):规格挡做错 / 验证挡做坏 / 回滚挡收不回 / 准入挡没人认领。场景题里谈上线,就把这四道闸各说一句。
排障统一表述:固定住一个变量,把问题一分为二
场景题被追问「上线后效果不好怎么查」,一律统一到这一句,它在本项目已有五个形态:
固定「文档」 → 切开 检索侧 / 生成侧 固定「输入」 → 切开 流量侧 / 系统侧 (金丝雀集) 固定「模型段」 → 切开 模型侧 / 链路侧 (首字延迟两刀) 固定「token 类别」 → 切开 输入侧 / 输出侧 (成本第一刀) 固定「变更集」 → 切开 变更侧 / 环境侧 (事故归因)
参数经验值
| 项 | 经验值 |
|---|---|
| 澄清阶段时长 | 不超过 2 分钟 / 4 个问题,且每个问题说明为什么问 |
| 基线预期 | 必须给数量级,宁可说错也不要不说 |
| 评测集起步 | 50–100 条真实问题起步,判分成本越高、集合越该小而精 |
| 统计关 | n=100、基线 80%,95% 置信区间约 ±7.8pt |
| 成本第一刀 | 先看输入/输出结构,不要一上来比单价 |
| 演进触发 | 用信号不用时间表,且要给退路 |
避坑清单
- 别上来画架构图。架构图是第 ③ 步的产物,出现在第 ① 步等于宣布你没听懂题。
- 别堆新词。GraphRAG、Agentic RAG、MCP 这些 2026 年的知晓率已经很高,说得出名字不加分,说得出什么时候不该用才加分。
- 别跳过基线。跳过基线的方案没有参照物,后面所有「效果提升」都无法论证。
- 别把评测放在最后一句带过。评测是唯一能证明你上过线的部分。
- 别用时间表冒充演进。「一期二期三期」是排期,不是判断。
- 成本别只谈单价。先谈结构,再谈单价,且知道 tokenizer 变化会吃掉降价。
- 别忘了说不做什么。一个只加不减的方案,听起来像没有约束。
| 随身表 | 内容 | 在场景题里怎么用 |
|---|---|---|
| 表一 · 三问决策树第 ③ 步主战场 | 不知道 → RAG;不会做 → 提档位 + prompt → SFT → RLVR;太贵太慢 → 蒸馏 / 路由 / 缓存 | 第 ③ 步选加挂时调用;第二支的顺序是分水岭,答得浅的会先去改提示词 |
| 表二 · 评测三条线 | 离线集 / 线上采样 / 业务指标;端到端 → 轨迹级 → 组件级 | 第 ④ 步;三条线互相佐证不互相替代,只在上一级掉分时下沉 |
| 表三 · 成本三刀 | 先切输入侧 / 输出侧,再切各侧内部,第三刀才是单价;九步从「不影响正确性」走到「影响正确性」 | 被追问「预算砍一半」时用;输出贵 5–6 倍,思考 token 计在输出侧 |
| 表四 · 四道闸 | 规格挡做错 / 验证挡做坏 / 回滚挡收不回 / 准入挡没人认领 | 场景题里谈上线,就把这四道闸各说一句 |
| 排障统一表述 | 固定住一个变量,把问题一分为二:固定文档切检索 / 生成,固定输入切流量 / 系统,固定变更集切变更 / 环境 | 被追问「上线后效果不好怎么查」时,一律统一到这一句 |
- 澄清阶段
- 不超过 2 分钟 / 4 个问题,且每个问题都要说明为什么问,否则像在拖延
- 基线预期
- 必须给一个数量级,宁可说错也不要不说 —— 这是「读过」和「做过」的分界
- 评测集起步
- 50–100 条真实问题起步;判分成本越高,集合越该小而精
- 统计关
- n=100、基线 80% 时 95% 置信区间约 ±7.8pt,涨 3 个点什么都说明不了
- 成本新陷阱
- 有的新模型换了 tokenizer,同样文本 token 数明显变多 —— 单价降三成、token 涨三成,账单没降
- 别忘了说不做什么
- 一个只加不减的方案,听起来像没有约束;架构图是第 ③ 步的产物,别摆在第 ① 步
面试视角
- 开场 30 秒定调「我先问四个问题,再给一个最土的基线」—— 这句话本身就是分数
- 澄清 2 分 + 基线 2 分四个问题都带上为什么问;基线给一个数量级的预期
- 加挂 4 分钟主战场:每加一样都给代价是什么 + 什么时候不该用
- 评测 3 分钟三条线各是什么、先端到端后下沉、零成本信号优先于 judge
- 演进 2 分钟,并说不做什么给触发信号并给退路,再明确说出「这些我不做」
- 上来就画架构图堆技术栈 —— 架构图是第 ③ 步的产物
- 直接给「最优方案」,跳过基线,增量没有参照物
- 每加一样只说好处,答不出什么时候不该用
- 「会做完善的评测」「提升了 3 个点」,不提 n 和置信区间
- 演进讲一期二期三期,成本只会说换个便宜模型
- 先问四个问题,且每个都说明为什么要问这一条
- 先给基线并估一个数量级,再谈增量值不值
- 每加一样都给「代价是什么 + 什么时候不该用」
- 三条线各是什么、先端到端后下沉;主动报 n 与置信区间
- 演进给触发信号并给退路;成本先切输入/输出结构再谈单价
Q8-01、Q8-04~Q8-10、Q2-25。面试官会怎么问
场景题一般出现在二面到三面,形式是「给你一个 XX 场景,从零设计」。它有三个特点:没有标准答案、追问一定会来、时间通常只有 10–15 分钟。所以答题的第一目标不是讲全,是让面试官在前两分钟就知道你的判断力在哪儿。
追问几乎必然落在三个方向:成本(预算砍一半先砍什么)、规模(日活涨一千倍架构变什么)、故障(上线后效果不好怎么查)。这三个方向在本章分别有专题题目,但通法都在上面四张表里。
答题结构建议
开场三十秒定调:「我先问四个问题,然后给一个最土的基线,再说需要加什么、每样的代价,最后说怎么评测和什么时候升级。」——这句话本身就是分数,因为它证明你有结构。
时间分配:澄清 2 分钟、基线 2 分钟、加挂 4 分钟、评测 3 分钟、演进 2 分钟。加挂那 4 分钟是主战场,但它的说服力来自基线那 2 分钟。
分水岭信号
| 只读过 | 真做过 |
|---|---|
| 上来就画架构图、堆技术栈 | 先问四个问题,且说明为什么问 |
| 直接给「最优方案」 | 先给基线并估一个数量级,再说增量 |
| 每加一样只说好处 | 每加一样都给「代价是什么 + 什么时候不该用」 |
| 「我们会做完善的评测」 | 三条线各是什么、先端到端后下沉、零成本信号优先于 judge |
| 「效果提升了 3 个点」 | 主动说 n 多少、置信区间多宽、够不够过统计关 |
| 演进讲一期二期三期 | 给触发信号,并且给退路 |
| 成本只会说换便宜模型 | 先切输入/输出结构,知道降本九步的顺序逻辑 |
| 方案只加不减 | 明确说「这些我不做,因为……」 |
小结与延伸
继续深入
本篇归属第 8 章「场景设计题」,去做这一章的题。