场景设计题的五步通法与四张随身表

T8-1模块 8 · 场景设计面试权重 更新于 2026-08-20

这篇学完你能回答什么

  1. 「给你一个新场景,从零设计一套方案」——这类开放题该按什么顺序讲?
  2. 为什么上来就画架构图的人分数最低?
  3. 面试官追问「预算砍一半」「日活涨一千倍」时,你的方案要怎么长得住?

从一个真实故障讲起

一家做工业设备的公司要做「售后手册问答」。技术负责人是从大厂出来的,方案定得很漂亮:文档进 GraphRAG 建实体关系图,检索层做 Agentic RAG 让模型自己决定查几轮,上面再挂一个多 Agent 编排——一个查手册、一个查工单历史、一个查备件库存,最后汇总。

做了三个月,上线两周后砍回去了。砍成什么样?BM25 + 向量的混合检索,加一个重排,加一句「找不到就说找不到」的提示词。 效果比原方案好,成本是原来的十七分之一。

复盘时最扎心的一句话来自客服主管:「我们的手册一共 400 篇,八成的问题集中在 30 篇里,而且都是『某某报警码是什么意思』。」

这个方案不是技术不好,是没人在开工前问过一句「不做这些的话,基线能到多少」。GraphRAG 解决的是跨文档多跳推理,这个场景里几乎没有多跳;Agentic RAG 解决的是查询复杂需要多轮探索,而这里八成是单跳查询;多 Agent 解决的是任务确实需要分工,而这里三个数据源根本不用同时查。

场景设计题考的就是这件事。 面试官不是想听你会多少种技术——2026 年这些概念的知晓率已经很高了,说得出名字不构成区分度。他想知道的是:你会不会先问清楚约束,会不会先给基线,会不会为每一样加挂说出代价。


全家桶做了三个月,败给一句没问的话
工业设备售后手册问答:GraphRAG + Agentic + 多 Agent 编排,上线两周被砍回去

  1. 接下场景

    工业设备售后手册问答,手册 400 篇

  2. 跳过基线断点

    没人问「不做这些能到多少」

  3. 直接上全家桶

    GraphRAG + Agentic + 多 Agent

  4. 做了三个月

    上线两周就被砍回去了

  5. 砍成最土的方案

    混合检索 + 重排 + 找不到就说找不到

成本三层全家桶土方案是它的十七分之一
真实问题分布手册 400 篇八成问题只落在 30 篇
GraphRAG 解决的跨文档多跳推理这个场景里几乎没有多跳
Agentic 解决的多轮探索复杂查询这里八成是单跳查询
复盘时最扎心的是客服主管那句:手册 400 篇,八成问题集中在 30 篇。不是技术选错了,是没人在开工前问过「不做这些,基线能到多少」 —— 场景题考的就是这一问。

核心概念:先打比方,再给定义

比方:不是考你会做多少菜,是考你会不会点菜

一个厨师上来就说「我给您做佛跳墙」,听着厉害,但他没问过:几个人吃、预算多少、有没有忌口、多久要上桌。真正的高手第一句话是问的,不是答的。

场景设计题里的「问」有四类:规模(数据多大、日活多少、并发峰值)、质量底线(答错的代价是什么,是尴尬还是赔钱)、约束(数据能不能出网、有没有权限隔离要求、延迟上限)、演进(这是要验证想法还是要直接上生产)。

定义:五步答题结构

这是本项目从第 2 章沿用至今的固定骨架,第 8 章十道题全部复用它:

原文示意
① 澄清需求  ─→ ② 给基线  ─→ ③ 加挂并说代价 ─→ ④ 谈评测 ─→ ⑤ 谈演进
   问清约束      最土的方案      每加一样都要      怎么知道       什么信号
   和成功标准    能到什么水平    答「代价是什么」   它变好了       出现才升级

它的本质是一个受约束优化问题的求解顺序:先确定约束(①),再找可行解(②),再在约束内做增量改进(③),再定义目标函数怎么测(④),最后规划迭代路径(⑤)。跳过任何一步,后面的话都悬空——没有约束就没有取舍,没有基线就没有增量,没有评测就没有「变好」。


考的不是会做多少菜,是会不会点菜
厨师上来就报佛跳墙,听着厉害 —— 他没问过几个人吃、预算多少、多久上桌

只会报菜名的厨师

开口就是佛跳墙,听着挺厉害

没问过几个人吃、预算多少、有没有忌口、多久要上桌

对应
上来就画架构图

GraphRAG / Agentic 张口就来

2026 年这些名字的知晓率已经很高,说得出名字不构成区分度

堆新词没约束没基线
真正的高手

第一句话是问的,不是答的

问完才知道这一桌该做什么,也知道什么可以不做

对应
先澄清再报方案

五步通法的第 ① 步,只花两分钟

问四类并且每个都带上「你为什么问」,否则听着像在拖延

规模质量底线约束演进
四类问题不是随便挑的:规模定索引方式、答错代价定兜底强度、出不出网定隔离层、现状就是你的基线。面试官说「你自己假设」时,明确说出假设再往下走,别卡在那里。

原理拆解

先有约束才有取舍,先有基线才有增量
它的本质是受约束优化的求解顺序:定约束 → 找可行解 → 在约束内做增量

澄清需求问四类问题,每个都带上「你为什么问」,不超过 2 分钟四类里最值钱的是「现在有没有人在做、怎么做的」—— 现状就是你的基线
给基线先说最土的方案能到什么水平,并给一个数量级的预期文档问答类:切块 + 向量 + BM25 混合 + 重排 + 「找不到就说找不到」;任务执行类:写死的 workflow,不上 Agent
加挂并说代价每加一样都答三件事:解决什么、代价是什么、什么时候不该用走三问决策树;「不会按要求做」那一支的第一动作是提 effort 档位,不是加提示词
谈评测离线集决定能不能发,线上采样决定发完有没有坏,业务指标终审但滞后端到端 → 轨迹级 → 组件级,只在上一级掉分时下沉;上来做组件级是最常见的浪费
谈演进给触发信号不给时间表,同时说清什么情况下这套要退回去「跨三四篇文档才能答」才考虑图结构;「人工兜底率长期高于 X%」才扩流程而不是扩模型
时间就 10–15 分钟:澄清 2 分、基线 2 分、加挂 4 分、评测 3 分、演进 2 分。加挂那 4 分钟是主战场,但它的说服力全来自基线那 2 分钟 —— 没有参照物,「提升」就是空话。

第 ① 步 澄清需求:问四类问题,但只花两分钟

不要变成盘问。问四个问题就够,并且每个问题都要带上「你为什么问」,否则听起来像在拖延:

问什么 为什么问(一定要说出来)
数据规模与更新频率 决定索引式还是检索式、要不要增量更新
答错的代价 决定「不知道就说不知道」的阈值和人工兜底的强度
数据出不出网、要不要权限隔离 决定能不能用公有云 API、隔离做在哪一层
现在有没有人在做、怎么做的 这条最值钱——现状就是你的基线

如果面试官说「你自己假设」,那就明确说出你的假设并继续,不要卡住。合格的表述是:「我按 10 万文档、日活 2000、答错只是效率损失不涉及资金来做,如果实际是金融场景我后面会改两处。」

第 ② 步 给基线:先说最土的方案能到什么水平

这一步是整道题的地基,也是最多人跳过的。基线的作用有三个:给增量一个参照物、给成本一个下限、给自己一个「什么时候可以停」的判据。

不同类型场景的典型基线:

原文示意
文档问答类   →  切块 + 向量检索 + BM25 混合 + 重排 + 「找不到就说找不到」
任务执行类   →  写死的 workflow(if/else + 三五个工具),不上 Agent
数据查询类   →  预置 20 条常用查询模板 + 参数填充,不上 NL2SQL
生成类       →  一个好 prompt + 三个 few-shot,不微调

说基线时必须给一个数量级的预期,哪怕是估的:「这套东西在这类场景一般能到七成上下的可用率,剩下三成集中在表格、多跳和口语化查询。」有没有这句话,是「读过」和「做过」的分界。

第 ③ 步 加挂并说代价:本项目的三段式铁律

每加一样东西,必须同时说三件事——解决什么、代价是什么、什么时候不该用。这一条是项目的内容铁律,也是场景题里区分度最高的地方,因为它无法背诵,只能来自真实取舍。

选什么加挂,用三问决策树(骨架 A):

原文示意
模型不知道这件事           → 挂 RAG(知识注入)
模型知道但不会按要求做     → 先提 effort 档位 + 改 prompt → 还不行才 SFT → 有可验证奖励再 RLVR
能做但太贵 / 太慢          → 蒸馏、路由、缓存

注意第二支的顺序:答得浅的第一动作是提档位,不是加提示词。这是本项目的冻结口径之一,2026 年仍然是高频分水岭。

第 ④ 步 谈评测:三条线 + 只在掉分时下沉

三条线(骨架 C)互相佐证、不互相替代:

  • 离线评测集——决定「能不能发」;
  • 线上采样——决定「发完有没有变坏」;
  • 业务指标——终审,但滞后。

层级下沉顺序(骨架 E):先端到端,端到端掉分了才看轨迹级,轨迹级定位不了才拆到组件级。上来就做组件级评测是最常见的浪费——你会得到一堆很漂亮但和最终效果无关的分数。

再补两条本项目的冻结口径:零成本信号优先于 judge(转人工率、重问率、截断率、复制率最被低估);分数变化必须过统计关(n=100、基线 80% 时 95% 置信区间大约 ±7.8 个百分点,涨了 3 个点什么都说明不了)。

第 ⑤ 步 谈演进:给触发信号,不给时间表

弱回答是「一期做 RAG,二期做 Agent,三期做微调」——这是排期不是演进。强回答是给出升级的触发信号

原文示意
出现「一个问题要跨三四篇文档才能答」→ 才考虑图结构
出现「查询需要多轮试探才能定位」    → 才考虑 Agentic 检索
出现「同一类需求每天几万次且稳定」  → 才考虑蒸馏小模型
出现「人工兜底率长期高于 X%」       → 才考虑扩流程而不是扩模型

同时要说反向条件:什么情况下这套要退回去。会说退路的人,比只会说前进的人可信得多。


工程实践(截至 2026-08)

四张随身表

表一 · 三问决策树:不知道 → RAG;不会做 → 提档位 + prompt → SFT → RLVR;太贵太慢 → 蒸馏 / 路由 / 缓存。

表二 · 评测三条线 + 下沉顺序:离线集 / 线上采样 / 业务指标;端到端 → 轨迹级 → 组件级,只在上一级掉分时下沉。

表三 · 成本三刀 + 降本九步

原文示意
第一刀  切输入侧 / 输出侧      (输出贵 5–6 倍,思考 token 计在输出侧)
第二刀  切各侧内部            (输入侧看缓存命中与重复注入;输出侧看轮次与档位)
第三刀  才是单价              (且只有降两档才有意义)

九步顺序:精确缓存 → 前缀缓存 → 批处理 → 削工具结果 → 降 effort
        → 修命中率 → 路由 → 语义缓存 → 减功能

顺序的逻辑是从「不影响正确性」走到「影响正确性」。前五步基本不动效果,第六步之后开始有代价,最后一步是承认做不到。要补一条 2026 的新陷阱:有的新模型换了 tokenizer,同样文本的 token 数会明显变多——单价降三成、token 涨三成,账单没降。

表四 · 四道闸(骨架 J):规格挡做错 / 验证挡做坏 / 回滚挡收不回 / 准入挡没人认领。场景题里谈上线,就把这四道闸各说一句。

排障统一表述:固定住一个变量,把问题一分为二

场景题被追问「上线后效果不好怎么查」,一律统一到这一句,它在本项目已有五个形态:

原文示意
固定「文档」       → 切开 检索侧 / 生成侧
固定「输入」       → 切开 流量侧 / 系统侧      (金丝雀集)
固定「模型段」     → 切开 模型侧 / 链路侧      (首字延迟两刀)
固定「token 类别」 → 切开 输入侧 / 输出侧      (成本第一刀)
固定「变更集」     → 切开 变更侧 / 环境侧      (事故归因)

参数经验值

经验值
澄清阶段时长 不超过 2 分钟 / 4 个问题,且每个问题说明为什么问
基线预期 必须给数量级,宁可说错也不要不说
评测集起步 50–100 条真实问题起步,判分成本越高、集合越该小而精
统计关 n=100、基线 80%,95% 置信区间约 ±7.8pt
成本第一刀 先看输入/输出结构,不要一上来比单价
演进触发 用信号不用时间表,且要给退路

避坑清单

  1. 别上来画架构图。架构图是第 ③ 步的产物,出现在第 ① 步等于宣布你没听懂题。
  2. 别堆新词。GraphRAG、Agentic RAG、MCP 这些 2026 年的知晓率已经很高,说得出名字不加分,说得出什么时候不该用才加分。
  3. 别跳过基线。跳过基线的方案没有参照物,后面所有「效果提升」都无法论证。
  4. 别把评测放在最后一句带过。评测是唯一能证明你上过线的部分。
  5. 别用时间表冒充演进。「一期二期三期」是排期,不是判断。
  6. 成本别只谈单价。先谈结构,再谈单价,且知道 tokenizer 变化会吃掉降价。
  7. 别忘了说不做什么。一个只加不减的方案,听起来像没有约束。

追问只有三个方向,四张表全接得住
成本、规模、故障 —— 二面三面的追问跑不出这三条,表要能随口调出来

四张随身表
随身表内容在场景题里怎么用
表一 · 三问决策树第 ③ 步主战场不知道 → RAG;不会做 → 提档位 + prompt → SFT → RLVR;太贵太慢 → 蒸馏 / 路由 / 缓存第 ③ 步选加挂时调用;第二支的顺序是分水岭,答得浅的会先去改提示词
表二 · 评测三条线离线集 / 线上采样 / 业务指标;端到端 → 轨迹级 → 组件级第 ④ 步;三条线互相佐证不互相替代,只在上一级掉分时下沉
表三 · 成本三刀先切输入侧 / 输出侧,再切各侧内部,第三刀才是单价;九步从「不影响正确性」走到「影响正确性」被追问「预算砍一半」时用;输出贵 5–6 倍,思考 token 计在输出侧
表四 · 四道闸规格挡做错 / 验证挡做坏 / 回滚挡收不回 / 准入挡没人认领场景题里谈上线,就把这四道闸各说一句
排障统一表述固定住一个变量,把问题一分为二:固定文档切检索 / 生成,固定输入切流量 / 系统,固定变更集切变更 / 环境被追问「上线后效果不好怎么查」时,一律统一到这一句
参数经验值与避坑
澄清阶段
不超过 2 分钟 / 4 个问题,且每个问题都要说明为什么问,否则像在拖延
基线预期
必须给一个数量级,宁可说错也不要不说 —— 这是「读过」和「做过」的分界
评测集起步
50–100 条真实问题起步;判分成本越高,集合越该小而精
统计关
n=100、基线 80% 时 95% 置信区间约 ±7.8pt,涨 3 个点什么都说明不了
成本新陷阱
有的新模型换了 tokenizer,同样文本 token 数明显变多 —— 单价降三成、token 涨三成,账单没降
别忘了说不做什么
一个只加不减的方案,听起来像没有约束;架构图是第 ③ 步的产物,别摆在第 ① 步
表不是拿来背的,是拿来当追问的接口:被问成本翻表三,被问上线翻表四,被问「效果不好怎么查」就翻排障那一句。没有表的人,追问一来就开始现编。

面试视角

10 分钟里,判断力要在前两分钟露出来
二面到三面、10–15 分钟、没有标准答案;追问必落在成本、规模、故障

  1. 开场 30 秒定调「我先问四个问题,再给一个最土的基线」—— 这句话本身就是分数
  2. 澄清 2 分 + 基线 2 分四个问题都带上为什么问;基线给一个数量级的预期
  3. 加挂 4 分钟主战场:每加一样都给代价是什么 + 什么时候不该用
  4. 评测 3 分钟三条线各是什么、先端到端后下沉、零成本信号优先于 judge
  5. 演进 2 分钟,并说不做什么给触发信号并给退路,再明确说出「这些我不做」
只读过:这些回答会暴露你
  • 上来就画架构图堆技术栈 —— 架构图是第 ③ 步的产物
  • 直接给「最优方案」,跳过基线,增量没有参照物
  • 每加一样只说好处,答不出什么时候不该用
  • 「会做完善的评测」「提升了 3 个点」,不提 n 和置信区间
  • 演进讲一期二期三期,成本只会说换个便宜模型
真做过:这些细节骗不了人
  • 先问四个问题,且每个都说明为什么要问这一条
  • 先给基线并估一个数量级,再谈增量值不值
  • 每加一样都给「代价是什么 + 什么时候不该用」
  • 三条线各是什么、先端到端后下沉;主动报 n 与置信区间
  • 演进给触发信号并给退路;成本先切输入/输出结构再谈单价
最少人做到的是最后一条:明确说出「这些我不做」并给出理由 —— 只加不减的方案听起来像没有约束。配套题目:Q8-01Q8-04~Q8-10Q2-25

面试官会怎么问

场景题一般出现在二面到三面,形式是「给你一个 XX 场景,从零设计」。它有三个特点:没有标准答案、追问一定会来、时间通常只有 10–15 分钟。所以答题的第一目标不是讲全,是让面试官在前两分钟就知道你的判断力在哪儿

追问几乎必然落在三个方向:成本(预算砍一半先砍什么)、规模(日活涨一千倍架构变什么)、故障(上线后效果不好怎么查)。这三个方向在本章分别有专题题目,但通法都在上面四张表里。

答题结构建议

开场三十秒定调:「我先问四个问题,然后给一个最土的基线,再说需要加什么、每样的代价,最后说怎么评测和什么时候升级。」——这句话本身就是分数,因为它证明你有结构。

时间分配:澄清 2 分钟、基线 2 分钟、加挂 4 分钟、评测 3 分钟、演进 2 分钟。加挂那 4 分钟是主战场,但它的说服力来自基线那 2 分钟。

分水岭信号

只读过 真做过
上来就画架构图、堆技术栈 先问四个问题,且说明为什么问
直接给「最优方案」 先给基线并估一个数量级,再说增量
每加一样只说好处 每加一样都给「代价是什么 + 什么时候不该用」
「我们会做完善的评测」 三条线各是什么、先端到端后下沉、零成本信号优先于 judge
「效果提升了 3 个点」 主动说 n 多少、置信区间多宽、够不够过统计关
演进讲一期二期三期 给触发信号,并且给退路
成本只会说换便宜模型 先切输入/输出结构,知道降本九步的顺序逻辑
方案只加不减 明确说「这些我不做,因为……」

小结与延伸

收口三句:

  1. 场景题考的是约束下的取舍,不是技术清单。约束没问清,后面全是空转。
  2. 基线是整道题的地基。没有基线,「提升」无从谈起,「值不值」也无从判断。
  3. 四张随身表——三问决策树、评测三条线、成本三刀、四道闸——覆盖了本章十道题的绝大部分追问,答题时直接调用即可。

延伸:Q2-25 是这套五步结构的原始出处,第 2 章的 RAG 架构选型是它的第一个实例;T8-2 讲 toB 场景绕不开的两条硬约束(权限隔离与人机协同),本章十道题里有六道会撞上它们。

继续深入

本篇归属第 8 章「场景设计题」,去做这一章的题