ByteDance logo
字节跳动
AI Agent算法专家-国际化电商

AI Agent算法专家-国际化电商

发布于 大约 2 个月前

普通员工/个人贡献者

杭州市
专家级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Agent框架
Claude Code
Grpo
Hermes
Openclaw
多智能体
强化学习
电商
算法

AI 估算 · 50k–80k

大厂核心AI岗位,技术前沿,人才稀缺,薪资竞争力强。

职位详情

关于这个职位

该职位负责构建国际化电商的AI Agent核心技术栈,包括开发Agent框架、工具集、强化学习训练以及自进化机制

你将参与前沿技术探索(如LangGraph、Codex等),并优化Agent系统的性能与稳定性,是电商治理智能化转型的关键角色

最低要求

精通Python编程,具备生产级应用的开发经验,熟悉Linux开发环境,并对数据结构和算法有深入理解

熟悉至少一种主流Agent框架,如LangGraph、OpenClaw、Hermes、Codex、Claude Code等,并有实际项目经验
深刻理解大模型(LLM)与AI Agent的核心原理,熟悉主流Agent架构(如ReAct/PlanAct)、多智能体系统(Multi-Agent)及上下文工程与记忆(Context Engineering/Memory)等概念
具备AI算法背景,对SFT、RLHF等Post-training技术有深入了解,有针对性优化模型能力的实践经验者优先
具备出色的技术沟通、项目管理和跨团队协同能力,能够撰写清晰的技术文档、教程和示例代码
对技术充满热情,具备优秀的分析和解决问题能力,能够主动追踪前沿技术并探索其在业务中的应用

工作职责

构建电商Agent大脑与技术落地:探索主流Agent框架,如LangGraph、OpenClaw、Hermes、Codex、Claude Code等,构建稳定可靠的Valley-Agent基座,重点提升任务的自动规划与调度、工具调用、多模态交互及深度研究能力

持续追踪AI Agent领域的最新进展(如Codex,OpenClaw,Hermes,ClaudeCode等),引入并验证新技术的可行性,沉淀技术文档与最佳实践,推动前沿技术在国际电商治理场景的创新应用
打造电商场景Skills工具集:基于电商业务系统,构建和优化一系列高性能、可复用的Skills
这包括利用小尺寸模型打造支撑高QPS场景的基础模型工具集,也包括将复杂的业务SOP(标准作业程序)封装为稳定可调用的治理Agent(如审核、RCA、立规Agent)
研发与优化Agentic RL:基于主流Agent框架,并结合Post-training技术(SFT/RLHF)与强化学习(PPO/GRPO)对模型进行持续优化,建立电商大模型的Agentic RL训练体系,提升模型在复杂问题上的准确率与动态反思能力
探索Agent自动化与自进化:结合Auto-Workflow与多智能体系统(MAS),一方面支持工作流的自动生成与优化,另一方面探索基于Agentic RAG和Memory机制的自进化(Self-Evolution)闭环,让Agent能够从真实交互数据中学习,持续提升其决策与执行能力
构建稳定可靠的Agent基础设施:负责Agent系统的性能与稳定性优化,包括资源利用、QPS、成本控制、环境交互速度等,并沉淀通用能力,构建包含可观测性与权限体系的Agent Infra,保障系统的安全可控

优先资格

在电商、内容风控、平台治理等领域有相关算法或研发经验

在强化学习领域有深入研究或实践经验,如Policy-based/Value-based methods、PPO、GRPO等
熟悉多模态(Multi-modal)推理技术,并有相关项目落地经验
对Agent安全(Safety)、成本优化、性能(QPS/稳定性)有深入思考或实践经验
在ICML、ICLR、NeurIPS、ACL、CVPR等学术会议上发表过有影响力的研究成果,或在ACM/ICPC、NOI/IOI、Kaggle等竞赛中获奖者
熟悉全球主流大模型服务及API,有设计并落地复杂Agent系统的经验

AI 洞察

优缺点分析

优点

  • 字节跳动大平台,国际化电商业务场景丰富,数据量大
  • 团队技术氛围浓厚,与顶尖人才合作,有学术和工业结合机会
  • 薪资待遇优厚,大厂福利体系完善
  • 业务复杂度高,电商治理场景多,需要快速理解业务逻辑
  • 技术迭代快,需要持续学习前沿框架和论文
  • 适合热爱AI Agent技术、有深厚算法功底、愿意在复杂业务场景中攻坚克难的求职者

缺点 / 挑战

  • 专注于前沿AI Agent技术,技术挑战大,成长速度快
  • 工作强度较大,可能需要应对高并发和稳定性压力

角色解读

  • 技术方向:从Agent工程师成长为AI架构师或技术专家
  • 管理方向:可转向AI团队的技术Leader或项目负责人
  • 行业方向:在AI Agent领域积累经验后,可进入更广泛的AI应用领域
  • 搭建电商治理的AI Agent核心系统,探索LangGraph等主流框架并落地
  • 开发可复用的Skills工具集,将复杂业务SOP封装为治理Agent
  • 利用SFT、RLHF、PPO等技术优化Agent的大模型能力
  • 研究Agent自动化与自进化机制,提升决策和执行效率
  • 精通Python和Linux开发,具备生产级工程能力
  • 熟悉至少一种主流Agent框架(LangGraph、OpenClaw等)
  • 深刻理解LLM与AI Agent原理(ReAct、Multi-Agent、Memory等)
  • 掌握Post-training技术(SFT、RLHF)和强化学习(PPO、GRPO)

申请策略

  • 在简历中附上技术博客或开源项目链接,展示对Agent领域的热情
  • 关注字节跳动国际化电商的技术文章,了解团队风格和业务痛点
  • 突出你在Agent框架(如LangGraph)上的实际项目经验
  • 强调强化学习或Post-training相关的实践成果(如PPO应用)
  • 展示你解决复杂工程问题的能力,如系统性能优化(QPS、稳定性)
  • 如果有电商、风控或治理相关经验,务必重点描述
  • 系统学习主流Agent框架的源码和设计模式
  • 补强强化学习理论,特别是Policy Gradient和PPO算法

面试指南

  • 使用STAR法则:场景-任务-行动-结果,具体说明项目背景、你的贡献和成果
  • 结构化的技术论述:先说出原理,再结合实际案例,最后总结优缺点和改进方向
  • 对比分析方法:将多种方案(如ReAct vs PlanAct)进行比较,展示深度思考
  • 请描述你设计过的一个Agent系统,包括框架选择、工具调用和任务规划
  • 如何优化Agent在高QPS场景下的响应速度和准确性?
  • 解释SFT和RLHF在LLM对齐中的异同,以及你在Agent中的应用经验
  • 多智能体系统中如何处理冲突和协调?
  • 如何实现Agent的自我进化(Self-Evolution)?请给出技术方案

职位点评

68
综合评分

大厂核心业务,前沿AI Agent技术栈,高回报高压力,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合注重技术成长和职业发展的求职者,愿意接受高强度工作以换取前沿技术积累。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值60

薪资福利

70中等

大厂核心岗位,薪资未明确但通常具有竞争力,福利体系完善。但JD未列出具体数字或津贴,补偿性动机满足程度中等偏上。

薪资信号未披露(AI估算:50K-80K/月)

成长发展

90较高

技术前沿(Agent框架、RL、多模态),大厂业务场景丰富,有大量学习和成长机会。JD强调追踪前沿、沉淀文档,发展性动机满足度高。

技术前沿前沿/新兴技术
技术栈Python、LangGraph、OpenClaw、Hermes、Codex、Claude Code、LLM、SFT、RLHF、PPO、GRPO、Multi-Agent、RAG
业务类型profit_center

工作生活

40较低

仅现场办公,杭州工作,未提及弹性或WLB,加班信号不明显但大厂核心岗通常强度较大。生活化动机满足度较低。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

电商是高速增长行业,Agent技术有实际商业价值,但社会影响力一般,属于中性偏正。意义感动机满足度中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs