
普通员工/个人贡献者
综合评分 86
顶尖人才计划,聚焦大模型Agent与强化学习前沿,薪资极高、技术挑战大,适合追求技术突破的顶尖极客。
从薪资福利、成长发展、工作生活和使命价值四个维度综合评估,方便比较职业起点。
薪资怎么样
7.5万
比机器学习工程中位数高
发布情况
新岗位 · 今天发布
公司情况
这家公司招聘很活跃
约 3100 个在招 · 其中机器学习工程 约 180 个
市场机会
选择面较广
杭州 · 机器学习工程 · 约 260 个在招
该职位致力于研发下一代Agentic System,通过强化学习技术提升大模型在复杂任务中的规划、反思与工具调用能力
系统掌握强化学习理论,熟悉 PPO / DPO / RLHF 等主流算法的原理与工程实践
研发下一代 Agentic System:通过多步规划(Planning)、反思(Reflection)与工具调用(Tool-Use)能力,为全球商家构建自动化“数字员工”,实现复杂任务闭环(如自动化选品、智能营销策划),端到端交付高价值业务结果,定义 AI 原生的 B2B 贸易新范式
有环境模拟器(Environment Design)或奖励函数(Reward Shaping)设计经验者优先
优点
缺点 / 挑战
作为顶尖人才计划,薪资极具竞争力,且依托知名平台,福利与稳定性均有极高保障。
处于大模型与强化学习最前沿,业务场景复杂且极具挑战,技术成长空间巨大。
JD未提及WLB相关信息,且顶尖人才计划通常伴随较高的业务挑战与工作强度。
致力于定义AI原生的B2B贸易新范式,为全球商家构建自动化数字员工,具有较高的商业价值与行业影响力。