
普通员工/个人贡献者
AI 估算 · 50k–80k
该职位专注于大语言模型的后训练与智能体(Agent)研发,包括SFT、偏好对齐(DPO/RLHF)以及强化学习等核心算法,旨在提升模型的推理与指令遵循能力
计算机科学、人工智能、数学或相关专业毕业,本科及以上学历(硕士或博士优先)
负责大语言模型LLM后训练阶段的核心算法研发与模型迭代,包括但不限于SFT、Reward Model训练以及强化学习DPO,GRPO,GSPO,Agentic RL等,持续提升模型作为Agent大脑的逻辑推理能力、指令遵循能力
有LLM后训练、强化学习、智能体(Agent)或计算机视觉等人工智能方向相关顶级会议(如ACL、NeurIPS、ICLR、CVPR等)论文发表者优先
优点
缺点 / 挑战
暂无明显挑战项
AI前沿技术岗,高薪高成长,但工作强度可能较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
薪资水平高,上市企业福利完善,但具体薪资未在JD中披露。
职位处于AI前沿技术领域,涉及最新后训练和Agent技术,成长空间大。
工作地点在深圳或北京,可能加班,JD未提及弹性工作。
AI技术推动行业进步,但公司业务偏安全,社会影响力中性。