面灵AI→

腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO

腾讯 大模型算法

腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。

2026-10

腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO

腾讯 大模型算法

腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。

2026-10

27届暑期实习腾讯WXG一面面经

腾讯 暑期实习 一面

腾讯WXG暑期实习一面面试经验分享。面试时长50分钟,面试官全程围绕单个项目进行深度挖掘,未安排代码编写环节。通过该面试流程及项目深挖侧重点,帮助求职者了解WXG面试风格,高效准备项目细节与技术栈。

2026-04