美团北斗大模型面试

第一轮面试

八股:LoRA 微调原理?训练时调过哪些超参数?有什么经验?

八股:SFT 的 loss 如何只计算回答部分?(如何 ignore padding token?)

八股:Attention 计算中有哪些显存优化策略?(如 KV Cache 复用、batch 拼接)

八股:分布式训练中 Zero-2 和 Zero-3 的核心区别是什么?

八股:Transformer 为什么用 LayerNorm 而不是 BatchNorm?

项目:项目中的数据规模多大?SFT 数据是如何清洗和构建的?

项目:为什么在项目中选择 GRPO 而不是 PPO 或 DPO?它解决了什么问题?

项目:奖励函数是如何设计的?是否考虑了事实正确性、安全性等维度?

项目:为什么引入 RAG?在什么场景下 RAG 比纯 SFT 更有效?

项目:用 LangGraph 实现多轮对话 Agent,相比手写 prompt 流程有哪些工程和效果优势?

代码题:lc102 二叉树的层序遍历

第二轮面试

八股:bf16 和 float16 的区别?各占多少位?训练中如何选择?

八股:DeepSpeed Zero 各阶段分别做了哪些优化?

八股:如何估算 LLaMA-7B 模型推理时的显存占用?

八股:Prefix LM、Causal LM、Encoder-Decoder 三类架构的适用场景与优缺点?

八股:Qwen 或 DeepSeek 技术报告中提到的关键创新点有哪些?(如 RoPE 外推、MoE)

项目:PPO/GRPO 微调后,如何防止模型在分布外(OOD)问题上性能崩塌?

项目:是否自己实现过 RLHF 流程?不用框架能否手写 PPO 核心逻辑?

项目:模型部署用了什么框架(vLLM/TGI/自研)?如何优化推理延迟和吞吐?

项目:未来希望专注大模型哪个方向?(对齐 / 推理加速 / 长上下文?)为什么?

代码题:LeetCode 25:K 个一组翻转链表

#AI面试##AI##我的求职进度条##实习面试记录#