Alibaba logo
阿里巴巴
Token Foundry-大模型算法专家-AI Coding

Token Foundry-大模型算法专家-AI Coding

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 杭州市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Agentic Coding
Auto Research
Pytorch
Qoder
Rl
Sft
大模型
Lingma
Mid-Train

AI 估算 · 40k–70k

大模型算法专家属于高薪技术岗,北京/杭州薪资水平高,阿里平台加持,硕士博士且需丰富经验,月薪区间合理。

职位详情

关于这个职位

这是一个专注于Agentic Coding大模型训练与落地的算法专家岗位,负责大模型的后训练(SFT/RL)算法设计,并将技术应用到Qoder、Lingma等产品中

你将参与前沿的AI Coding技术研发,适合有大模型训练经验、热爱技术挑战的硕士/博士

最低要求

人工智能(AI)/ 软件工程(SE)相关方向的硕士 / 博士,有扎实大模型基础和丰富大模型训练经验

曾负责或作为核心同学参与大模型的训练(预训练、后训练)
有一定的研究经历
具备优秀的分析问题和解决问题的能力,以及良好的沟通协作能力

工作职责

负责Agentic Coding大模型(Agentic LLM for Software Engineering)的后训练(Mid-Train/SFT/RL)算法设计和训练研究等

打造面向真实软件开发的智能化全链路技术,包括但不限于Agentic Coding、Agent Teams 等技术
建设大模型训练的Harness体系,探索Auto Research相关技术在大模型后训练的应用
将上述技术在 Qoder、Lingma 及 CLI 等产品形态中进行大规模应用落地

优先资格

熟悉代码大模型训练技术者优先

发表过顶会论文者优先,如ICLR、NeurIPS、ICML、FSE、ISSTA等

AI 洞察

优缺点分析

优点

  • 站在大模型技术最前沿,Agentic Coding是当前AI领域的热点,技能积累极具市场价值
  • 阿里提供超大规模算力和丰富业务场景,技术落地机会多,能快速验证研究成果
  • 薪酬竞争力强,且作为核心岗位,个人在行业内的影响力容易提升
  • 团队氛围偏研究型,鼓励发表顶会论文,学术与工业结合良好
  • 跨团队协作多,需要与工程、产品团队紧密配合,沟通成本高

缺点 / 挑战

  • 大模型训练需要大量时间和资源,实验周期长,可能面临频繁试错的心理压力
  • 技术迭代快,需要持续学习最新论文,保持竞争力,工作强度可能较高
  • 适合拥有扎实大模型训练经验、热爱技术挑战、自驱力强且能适应快节奏的算法工程师

角色解读

  • 可从算法专家晋升为高级专家/技术Leader,带领团队攻关大模型方向
  • 横向扩展到Agentic AI、智能体系统等更前沿领域,成为领域专家
  • 有机会在阿里内部跨业务调动,接触超大规模训练基础设施,积累稀缺经验
  • 设计并训练Agentic Coding大模型,重点在后训练阶段(SFT/RL),提升模型在真实软件开发中的能力
  • 打造Agentic Coding、Agent Teams等全链路智能化技术,推动AI编程从单模型走向多智能体协作
  • 建设大模型训练的Harness体系,探索Auto Research技术自动化优化训练流程
  • 将研究成果快速落地到Qoder、Lingma、CLI等产品,让技术直接服务于用户
  • 扎实的机器学习/深度学习基础,尤其熟悉Transformer架构和大模型训练原理
  • 丰富的实际操作经验,曾参与预训练或后训练,熟悉SFT、RLHF、PPO等训练方法
  • 较强的工程能力,能编写高质量Python代码,熟悉PyTorch等框架,了解分布式训练
  • 科研能力,能阅读前沿论文并复现,有顶会论文发表是加分项

申请策略

  • 关注阿里巴巴Qoder和Lingma的产品规划,了解当前AI Coding产品的市场布局,在面试中展现业务敏感度
  • 提前准备1-2个自己主导的技术方案,能清晰阐述从问题定义到技术落地的全过程
  • 突出你参与过的大模型训练项目,尤其是后训练(SFT/RL)的具体细节,包括数据规模、模型参数量、指标提升等
  • 强调你在代码生成或软件工程方向的任何工作,如代码模型、Agent系统,附上GitHub或论文链接
  • 展示你的工程能力,如分布式训练优化、训练框架开发等,体现能落地的技术深度
  • 如果发表过顶会论文,务必写在显眼位置,并简述与岗位的关联
  • 熟悉Agentic Coding相关开源项目(如SWE-bench、AutoGPT、MetaGPT),尝试复现并提供改进思路
  • 补充RL环节的实践,如PPO、GRPO等算法,了解最新的RLVR(可验证奖励)技术

面试指南

  • 针对项目经验问题,用STAR法则(情境-任务-行动-结果)结构化回答,突出个人贡献和量化结果
  • 对技术方案题,先明确目标,再比较不同方案,提出你自己的权衡,最后给出推荐并说明理由
  • 对开放性产品题,结合你对产品和行业的了解,展示逻辑性和前瞻性
  • 请详细描述你参与过的后训练项目,包括数据、模型、算法和最终效果
  • SFT和RL在代码生成模型中各自的作用是什么?如何设计训练策略?
  • 如何评估Agentic Coding模型的能力?你推荐哪些基准?
  • 在分布式训练中遇到OOM或训练不稳定怎么处理?
  • 你对Qoder这类AI编程工具的未来有什么看法?

职位点评

72
综合评分

顶级大厂、前沿大模型训练方向、高薪但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最看重技术成长和前沿挑战、能承受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展92
工作生活50
使命价值65

薪资福利

70中等

该职位薪资水平高,但JD未明确列出福利,需面试确认。作为上市巨头,整体薪酬福利有竞争力。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

92较高

大模型训练是前沿领域,可接触亿级参数模型和先进训练方法,技术成长空间极大。公司提供丰富的科研资源和上升通道。

技术前沿前沿/新兴技术
技术栈Agentic Coding、SFT、RL、Mid-Train、大模型、Auto Research
业务类型ambiguous

工作生活

50较低

职位要求现场办公,地点在北京/杭州,通勤情况未知。大模型实验强度大,可能面临加班,但未从JD直接体现。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

AI Coding技术有望极大提升开发者效率,具有较高的技术价值,但JD未强调社会使命。行业处于高速增长期。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs