
字节跳动
AI算法工程师(Agent Model Post-Training)-即梦
AI算法工程师(Agent Model Post-Training)-即梦
发布于 大约 2 个月前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Grpo
Rlaif
多模态
大模型后训练
DPO
PPO
PyTorch
RLHF
SFT
AI 估算 · 30k–60k
AI算法核心岗位,大厂高薪,技术门槛高,市场竞争力强
职位详情
关于这个职位
该职位负责即梦创作Agent模型的后训练,提升模型在创作理解、任务规划和多轮交互中的表现
你将构建训练数据、探索强化学习方法,并与多团队协作实现持续迭代
适合对大模型后训练和Agent技术有浓厚兴趣的算法工程师
最低要求
本科及以上学历,具备扎实的机器学习、深度学习和概率统计基础
熟悉大模型后训练方法,包括但不限于SFT、RLHF、DPO、PPO、GRPO、RLAIF等
熟练掌握PyTorch等主流深度学习框架,具备模型训练、数据处理和实验分析经验
对Agentic RL、Tool Use、多轮Function Call、多模态模型训练有浓厚兴趣
具备良好的实验设计能力和问题分析能力,能够从业务问题抽象出可训练、可评估的技术目标
工作职责
负责即梦创作Agent模型的后训练能力建设,提升模型在创作理解、任务规划、工具调用和多轮交互中的表现
构建Agent SFT数据、多轮Function Call数据、工具轨迹数据和创作任务偏好数据
探索Agentic RL、Rubrics-based RL、Unified Reward System等方法,提升Agent长链路任务成功率
结合图片、视频、编辑、素材理解等多模态创作场景,提升模型对创作语言、视觉风格和用户意图的理解能力
与Harness、评估、数据和产品团队协作,形成模型训练、自动化评估、线上反馈的持续迭代闭环
AI 洞察
优缺点分析
优点
- 岗位涉及前沿的大模型后训练和Agent技术,技术成长空间大
- 薪资待遇在行业内极具竞争力,且有机会获得股票期权
- 涉及多团队协作,沟通成本高,需要较强的跨部门协调能力
- 模型训练和实验周期长,结果不确定性高,需要耐心和实验设计能力
- 适合对AI技术有浓厚热情、追求技术深度、愿意在高强度环境中快速成长的算法工程师
缺点 / 挑战
- 字节跳动作为互联网大厂,平台资源丰富,数据量大,能接触到实际业务挑战
- 技术迭代快,需要持续学习,工作压力较大
角色解读
- 可成长为AI算法专家,在大模型后训练和Agent领域深耕
- 有机会向技术团队Leader发展,带领项目方向
- 也可转向产品化或研究导向,参与更前沿的AI技术探索
- 负责即梦创作Agent模型的后训练,提升模型在创作理解、任务规划、工具调用和多轮交互中的表现
- 构建Agent SFT数据、多轮Function Call数据、工具轨迹数据和创作任务偏好数据
- 探索Agentic RL、Rubrics-based RL等方法,提升Agent长链路任务成功率
- 与Harness、评估、数据和产品团队协作,形成持续迭代闭环
- 扎实的机器学习、深度学习和概率统计基础
- 熟悉大模型后训练方法,如SFT、RLHF、DPO、PPO、GRPO等
- 熟练掌握PyTorch等深度学习框架,具备模型训练和数据处理经验
- 对Agentic RL、Tool Use、多轮Function Call、多模态模型训练有浓厚兴趣
申请策略
- 了解字节跳动即梦产品的业务场景,思考Agent模型如何提升用户体验
- 在简历中量化成果,如提升模型准确率或任务成功率的具体数值
- 重点突出大模型后训练相关项目经验,如SFT、RLHF的应用案例
- 展示在PyTorch框架下进行模型训练、数据 pipeline 和调优的具体成果
- 如果有Agent、Tool Use或多模态相关研究或实践,务必强调
- 补充强化学习理论知识,特别是PPO、GRPO等算法
- 熟悉多模态模型(如CLIP、BLIP)和工具调用(Function Call)的实现
面试指南
- 先阐述核心原理,再结合具体项目经验,最后提出优化思路
- 对于方法对比题,列出关键差异(如训练稳定性、样本效率等),给出选择依据
- 遇到开放性问题时,结构化回答:问题定义、可能方案、评估指标、迭代计划
- 请详细解释RLHF的训练流程及其在LLM中的应用
- 如何设计一个Agent多轮交互的SFT数据集?
- 对比DPO和PPO的优缺点,并说明在什么场景下使用
- 如果Agent在工具调用中失败率很高,你会如何优化?
- 请描述一次你通过实验设计解决模型训练问题的经验
职位点评
74
综合评分
大厂AI算法核心岗位,前沿技术,高薪,但工作强度大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和高薪、愿意投入高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活30
使命价值80
薪资福利
85较高
字节跳动AI算法岗位薪资在行业内处于偏高水平,福利完善,但工作强度较大,补偿性动机满足度高。
薪资信号偏高 (30K-60K/月)
成长发展
90较高
岗位涉及前沿的大模型后训练和Agent技术,技术栈新,成长空间大,发展性动机满足度很高。
技术前沿前沿/新兴技术
技术栈Agent Post-Training、SFT、RLHF、DPO、PPO、GRPO、RLAIF、PyTorch、多模态
业务类型profit_center
工作生活
30较低
仅现场办公,未提及弹性工作或WLB,且互联网大厂通常工作强度大,生活化动机满足度较低。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
80较高
AI创作领域属于高速增长赛道,技术革新快,但社会影响力中性,意义感动机满足度较高。
行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
字节跳动 的其他在招职位
相似职位推荐
Watch Jobs