TwKit

推文

@NFT_Chen · 2026-10-09 16:00

💥揭秘!小米 MiMo V2.7-3.0 Pro 的模型推理优化岗,面试直接把底牌摊开了! 面试官来自基础架构 AI Infra,团队负责自研 MiMo 系列(含 MiMo V2.7 Pro)推理优化,日调用量数十亿 token。岗位是推理框架团队,大模型推理优化方向(推理引擎/算子)。 不是背名词,仿真、调度、缓存收益边界和手写实现全问: 1️⃣ TerarkKVCache / HiCache 是什么,多级缓存 offload 到 CPU / 分布式存储 / Disk 的必要性与带宽 trade-off 2️⃣ SGLang radix cache 怎么管,请求如何按 token id 做最长前缀匹配 3️⃣ 多级缓存何时有收益:G2→G1 加载时间 < 命中部分重新 prefill 的时间 4️⃣ 高并发服务权衡什么:吞吐、TTFT/TPOT、释放算力速度 5️⃣ AI Configurator 算子 latency 数据来源(实测 / SOL 理论值 / 插值),MAPE 如何验证到 <10% 6️⃣ PD 分离仿真核心:单进程虚拟时钟与状态机(waiting prefill→prefill→KV transit→decode),P/D worker 按 KV 容量绑定,worker pool/replicas(TP/PP/DP),mix chunk 优先 decode 7️⃣ Cache-aware + load score 路由打分策略,和 Dynamo 的对比 8️⃣ TP/DP/EP 背景与优劣:MoE 中 DP attention、DP×TP=EP、EP 的 all-to-all 通信 9️⃣ 手写公式:MHA 的 KV cache 显存 (2 \times B \times S \times heads \times head_dim \times bytes \times layers),TP 下如何切分 🔟 手写 C++:LRU Cache(双向链表 + 哈希表) 1️⃣1️⃣ 反问透露:人均至少 8 卡 H200;MiMo 用 SWA 滑动窗口注意力减少 KV 存储与传输,是团队重点方向 想冲 MiMo V2.7-3.0 Pro 的推理 Infra,这套题基本就是准入线了。 #AI面经 #AI面试题 #小米 #AIInfra #大模型推理 #MiMo #MiMoV27Pro #罗福莉

曝光 5809 · 评论 7 · 点赞 41 · 书签 31 · 曝光/时 2003.657554065829