返回招聘首页
目前应用它的产品
智信
探索用于企业工作流决策、评分与验证的模型,使用获准的反馈,同时保留执行权限边界与人工复核。
智选
当独立评估表明优于现有模型基线时,探索用于证据评估与研究质量的专用模型。
你将做的工作
- 从经授权、脱敏的工作流轨迹与人工核实结果中构建训练及偏好数据,记录来源,保持评估集独立。
- 建立现有模型基线,在证据支持时通过监督微调、参数高效适配与蒸馏开发专用模型。
- 在任务具有可靠反馈与受控评估环境时,研究用于智能体行为的奖励模型、偏好优化与强化学习。
- 通过可复现实验与独立工作流测试比较训练方法,评估任务成功率、泛化能力、安全回归、推理延迟与成本。
- 构建训练与推理流水线,维护数据版本、检查点与回滚路径;模型变更经审核与回归检查后再部署。
- 与评估及系统工程师协作,把经核实的反馈变成经审核的改进。分离模型学习与实际执行,不把未经核实的智能体自评作为训练目标。
我们希望你能做到
- 扎实的 Python 与 PyTorch 能力,有模型训练、调试与可复现实验管理经验。
- 有语言模型微调或蒸馏实践,能够准备数据集,并相对基线衡量结果。
- 理解优化、过拟合、数据污染与泛化,能够为声称的改进设计独立测试。
- 能够构建与分析模型推理流水线,理解 GPU 显存限制,在模型质量、延迟与成本之间做出有效取舍。
- 对授权、敏感数据、经核实反馈与自动评分的能力边界有良好判断。
有帮助的经验
- 有奖励建模、DPO 等偏好优化,或基于可验证奖励的强化学习经验。
- 有智能体训练环境、任务轨迹数据集、过程监督或从人工纠正中学习的经验。
- 有分布式训练、参数高效适配、量化,或在受限算力预算内部署专用模型的经验。
为什么这份工作值得投入
- 研究可靠反馈如何带来实用智能体行为的可衡量改进。
- 选择最简单且有效的训练方法,并用实际工作流要求验证。
- 与评估及系统工程师一起,从实验到经审核的发布,开发可复用模型能力。
如何申请
请发送简短自我介绍,以及相关代码、项目或作品集的链接;简历可选。说说你做了什么、排查过什么失败,以及如何验证结果是否有效。我们看重可证明的能力,不设特定学历或工作年限门槛。
会打开你的邮件应用,并附上写给我们的预先准备的草稿。