面灵AI→

腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO

腾讯 大模型算法

腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。

2026-10

腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO

腾讯 大模型算法

腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。

2026-10