
字节跳动
AI Agent算法专家-国际化电商
AI Agent算法专家-国际化电商
发布于 大约 2 个月前普通员工/个人贡献者
杭州市
专家级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Agent框架
Claude Code
Grpo
Hermes
Openclaw
多智能体
强化学习
电商
算法
AI 估算 · 50k–80k
大厂核心AI岗位,技术前沿,人才稀缺,薪资竞争力强。
职位详情
关于这个职位
该职位负责构建国际化电商的AI Agent核心技术栈,包括开发Agent框架、工具集、强化学习训练以及自进化机制
你将参与前沿技术探索(如LangGraph、Codex等),并优化Agent系统的性能与稳定性,是电商治理智能化转型的关键角色
最低要求
精通Python编程,具备生产级应用的开发经验,熟悉Linux开发环境,并对数据结构和算法有深入理解
熟悉至少一种主流Agent框架,如LangGraph、OpenClaw、Hermes、Codex、Claude Code等,并有实际项目经验
深刻理解大模型(LLM)与AI Agent的核心原理,熟悉主流Agent架构(如ReAct/PlanAct)、多智能体系统(Multi-Agent)及上下文工程与记忆(Context Engineering/Memory)等概念
具备AI算法背景,对SFT、RLHF等Post-training技术有深入了解,有针对性优化模型能力的实践经验者优先
具备出色的技术沟通、项目管理和跨团队协同能力,能够撰写清晰的技术文档、教程和示例代码
对技术充满热情,具备优秀的分析和解决问题能力,能够主动追踪前沿技术并探索其在业务中的应用
工作职责
构建电商Agent大脑与技术落地:探索主流Agent框架,如LangGraph、OpenClaw、Hermes、Codex、Claude Code等,构建稳定可靠的Valley-Agent基座,重点提升任务的自动规划与调度、工具调用、多模态交互及深度研究能力
持续追踪AI Agent领域的最新进展(如Codex,OpenClaw,Hermes,ClaudeCode等),引入并验证新技术的可行性,沉淀技术文档与最佳实践,推动前沿技术在国际电商治理场景的创新应用
打造电商场景Skills工具集:基于电商业务系统,构建和优化一系列高性能、可复用的Skills
这包括利用小尺寸模型打造支撑高QPS场景的基础模型工具集,也包括将复杂的业务SOP(标准作业程序)封装为稳定可调用的治理Agent(如审核、RCA、立规Agent)
研发与优化Agentic RL:基于主流Agent框架,并结合Post-training技术(SFT/RLHF)与强化学习(PPO/GRPO)对模型进行持续优化,建立电商大模型的Agentic RL训练体系,提升模型在复杂问题上的准确率与动态反思能力
探索Agent自动化与自进化:结合Auto-Workflow与多智能体系统(MAS),一方面支持工作流的自动生成与优化,另一方面探索基于Agentic RAG和Memory机制的自进化(Self-Evolution)闭环,让Agent能够从真实交互数据中学习,持续提升其决策与执行能力
构建稳定可靠的Agent基础设施:负责Agent系统的性能与稳定性优化,包括资源利用、QPS、成本控制、环境交互速度等,并沉淀通用能力,构建包含可观测性与权限体系的Agent Infra,保障系统的安全可控
优先资格
在电商、内容风控、平台治理等领域有相关算法或研发经验
在强化学习领域有深入研究或实践经验,如Policy-based/Value-based methods、PPO、GRPO等
熟悉多模态(Multi-modal)推理技术,并有相关项目落地经验
对Agent安全(Safety)、成本优化、性能(QPS/稳定性)有深入思考或实践经验
在ICML、ICLR、NeurIPS、ACL、CVPR等学术会议上发表过有影响力的研究成果,或在ACM/ICPC、NOI/IOI、Kaggle等竞赛中获奖者
熟悉全球主流大模型服务及API,有设计并落地复杂Agent系统的经验
AI 洞察
优缺点分析
优点
- 字节跳动大平台,国际化电商业务场景丰富,数据量大
- 团队技术氛围浓厚,与顶尖人才合作,有学术和工业结合机会
- 薪资待遇优厚,大厂福利体系完善
- 业务复杂度高,电商治理场景多,需要快速理解业务逻辑
- 技术迭代快,需要持续学习前沿框架和论文
- 适合热爱AI Agent技术、有深厚算法功底、愿意在复杂业务场景中攻坚克难的求职者
缺点 / 挑战
- 专注于前沿AI Agent技术,技术挑战大,成长速度快
- 工作强度较大,可能需要应对高并发和稳定性压力
角色解读
- 技术方向:从Agent工程师成长为AI架构师或技术专家
- 管理方向:可转向AI团队的技术Leader或项目负责人
- 行业方向:在AI Agent领域积累经验后,可进入更广泛的AI应用领域
- 搭建电商治理的AI Agent核心系统,探索LangGraph等主流框架并落地
- 开发可复用的Skills工具集,将复杂业务SOP封装为治理Agent
- 利用SFT、RLHF、PPO等技术优化Agent的大模型能力
- 研究Agent自动化与自进化机制,提升决策和执行效率
- 精通Python和Linux开发,具备生产级工程能力
- 熟悉至少一种主流Agent框架(LangGraph、OpenClaw等)
- 深刻理解LLM与AI Agent原理(ReAct、Multi-Agent、Memory等)
- 掌握Post-training技术(SFT、RLHF)和强化学习(PPO、GRPO)
申请策略
- 在简历中附上技术博客或开源项目链接,展示对Agent领域的热情
- 关注字节跳动国际化电商的技术文章,了解团队风格和业务痛点
- 突出你在Agent框架(如LangGraph)上的实际项目经验
- 强调强化学习或Post-training相关的实践成果(如PPO应用)
- 展示你解决复杂工程问题的能力,如系统性能优化(QPS、稳定性)
- 如果有电商、风控或治理相关经验,务必重点描述
- 系统学习主流Agent框架的源码和设计模式
- 补强强化学习理论,特别是Policy Gradient和PPO算法
面试指南
- 使用STAR法则:场景-任务-行动-结果,具体说明项目背景、你的贡献和成果
- 结构化的技术论述:先说出原理,再结合实际案例,最后总结优缺点和改进方向
- 对比分析方法:将多种方案(如ReAct vs PlanAct)进行比较,展示深度思考
- 请描述你设计过的一个Agent系统,包括框架选择、工具调用和任务规划
- 如何优化Agent在高QPS场景下的响应速度和准确性?
- 解释SFT和RLHF在LLM对齐中的异同,以及你在Agent中的应用经验
- 多智能体系统中如何处理冲突和协调?
- 如何实现Agent的自我进化(Self-Evolution)?请给出技术方案
职位点评
68
综合评分
大厂核心业务,前沿AI Agent技术栈,高回报高压力,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合注重技术成长和职业发展的求职者,愿意接受高强度工作以换取前沿技术积累。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值60
薪资福利
70中等
大厂核心岗位,薪资未明确但通常具有竞争力,福利体系完善。但JD未列出具体数字或津贴,补偿性动机满足程度中等偏上。
薪资信号未披露(AI估算:50K-80K/月)
成长发展
90较高
技术前沿(Agent框架、RL、多模态),大厂业务场景丰富,有大量学习和成长机会。JD强调追踪前沿、沉淀文档,发展性动机满足度高。
技术前沿前沿/新兴技术
技术栈Python、LangGraph、OpenClaw、Hermes、Codex、Claude Code、LLM、SFT、RLHF、PPO、GRPO、Multi-Agent、RAG
业务类型profit_center
工作生活
40较低
仅现场办公,杭州工作,未提及弹性或WLB,加班信号不明显但大厂核心岗通常强度较大。生活化动机满足度较低。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
电商是高速增长行业,Agent技术有实际商业价值,但社会影响力一般,属于中性偏正。意义感动机满足度中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
字节跳动 的其他在招职位
相似职位推荐
Watch Jobs