# 面试故事库（demo）

pipeline 每评估一份新岗位就把 3 段结构化的过去经历（情景 / 任务 / 动作 / 结果 / 反思）追加进这里，长期变成你自己的故事库。下面三段来自 Aurora Labs 评估报告（#001）。

---

## 故事 1 — 「production LLM systems」

- **情景：** 老 recsys 停在 12% CTR；用户反馈推荐「太重复」。
- **任务：** 加一层 LLM 重排，但不能拉高延迟 SLO，也不能让服务成本失控。
- **动作：** 建一个轻量重排器；per-tenant 调参；用 A/B 门 + per-slice 指标做自动回滚。
- **结果：** 12 A/B 周 +18% 转化，延迟 SLO 全程守住。
- **反思：** 真正拿分的是那个 eval 门，不是模型本身。下次会先设计门，再选模型。

---

## 故事 2 — 「rollout with confidence」

- **情景：** 模型上线周期 ~2 周，1/4 概率带回归到 prod。
- **任务：** 缩短周期，但不能牺牲安全。
- **动作：** 串起 GitHub Actions + SageMaker + held-out eval 门（回归即阻断 merge），补 per-slice 指标。
- **结果：** 2 周 → 4 小时。之后 6 个月里 0 起模型回归上线。
- **反思：** 缺的那一格是 per-slice eval——曾经有一次段级回归被总量指标掩盖过。

---

## 故事 3 — 「observability & on-call」

- **情景：** 模型监控只看尾部丢弃指标；drift 靠客户投诉才发现。
- **任务：** 在客户注意到之前就发现 drift。
- **动作：** 建 drift 仪表盘（Grafana）+ 性能 SLI（延迟 / 吞吐 / 质量）+ 越界即触发自动重训。
- **结果：** 待命负担 -35%，drift 发现时间从 5 天缩到 6 小时。
- **反思：** 还欠一条「成本/成功请求」SLI 和延迟、质量并列——下一份工作我会 day-one 就开这张 ticket。
