ByteDance logo
字节跳动
电商场景LLM/VLM/AIGC训练工程师-TikTok Shop

电商场景LLM/VLM/AIGC训练工程师-TikTok Shop

发布于 大约 8 小时前

普通员工/个人贡献者

北京市
初级经验
全职员工
仅现场办公
本科
机器学习工程
Aigc
Cuda
Deepspeed
Llm
Megatron
Pytorch
Tensorflow
Vlm
分布式训练

AI 估算 · 30k–60k

大厂核心AI训练岗,LLM方向稀缺,薪资高于普通后端,字节年终奖较高。

职位详情

关于这个职位

负责电商场景下LLM/VLM/AIGC模型的训练优化,使用分布式训练框架(如DeepSpeed/Megatron)和CUDA优化提升训练效率,与算法团队协作将模型落地到电商产品线

适合对AI基础设施、性能优化和前沿大模型技术有热情的工程师

最低要求

本科及以上学历

熟练掌握Linux环境下的C/C++或Python语言
了解深度学习算法基本原理,熟悉神经网络基本架构和各算子计算方式,1年以上AutoML、模型推理/训练优化或AI相关工作经验
能够熟练使用至少一种主流的机器学习框架(TensorFlow/PyTorch/MxNet或其他自研框架)
了解主流LLM/VLM/AIGC算法模型
具有独立解决问题的能力,良好的团队合作精神,有强烈的工作责任心,较好的学习能力、沟通能力和自驱力

工作职责

负责电商LLM/VLM/AIGC训练优化算法研究(和算法团队合作)和落地

通过数据并行、模型并行、Pipeline并行、通信优化等基于CUDA的分布式训练框架大幅提升模型的训练速度与效率
攻克电商LLM/VLM/AIGC训练全流程中工程技术问题,包括CT、SFT、RL等多个阶段,覆盖性能、资源、调度、平台化等能力
与公司各算法部门深度合作,分析业务性能瓶颈,通过软硬结合的方式,高效部署与优化业务模型,落地到电商各产品线,投入AI工具链开发及技术生态的建设,支撑电商AI方向重要业务的发展

优先资格

计算机、软件工程、人工智能等相关专业优先

熟悉各种模型/数据并行训练框架优先
有LLM/VLM/AIGC模型训练加速落地经验者优先
有大模型训练优化经验,熟悉FSDP/DeepSpeed/Megatron等分布式训练框架经验者优先

AI 洞察

优缺点分析

优点

  • 前沿技术场景:直接参与LLM/VLM/AIGC训练优化,技术革新快,个人成长空间大
  • 大厂平台:字节跳动技术氛围浓厚,有完善的工具链和数据基础设施,能接触大规模真实业务
  • 高回报:AI训练方向人才稀缺,薪资和职业前景都有较强竞争力
  • 业务驱动:电商场景模型落地链路清晰,成果容易体现价值
  • 技术门槛高:需要同时掌握深度学习、分布式系统、CUDA优化等多领域知识,学习曲线陡峭
  • 竞争激烈:公司内优秀人才多,需要持续学习和突破才能脱颖而出

缺点 / 挑战

  • 工作强度可能较大:大厂业务节奏快,项目交付压力可能存在加班情况
  • 适合对AI基础设施和大模型训练有强烈兴趣,喜欢挑战高难度技术问题,具备扎实编程和深度学习基础、抗压能力强的工程师

角色解读

  • 技术深度路线:从训练工程师成长为分布式系统/AI基础设施专家,深入CUDA优化和框架内核开发
  • 业务广度路线:与算法团队紧密合作,逐步向AI解决方案架构师或技术负责人方向发展
  • 管理路线:在技术积累基础上,未来可带团队、负责AI平台的整体架构和规划
  • 负责电商场景下大规模LLM/VLM/AIGC模型的训练优化,包括分布式训练框架的工程实现和性能调优
  • 与算法团队合作,针对模型训练中的性能瓶颈进行软硬件协同优化,提升训练速度和资源利用率
  • 参与AI工具链和平台化建设,支持电商各产品线的模型部署与迭代
  • 扎实的编程基础:熟练掌握C/C++或Python,熟悉Linux环境下的开发
  • 深度学习与分布式训练知识:了解神经网络架构,熟悉TensorFlow/PyTorch等框架,了解数据并行、模型并行等分布式训练技术
  • 熟悉主流大模型技术:了解LLM/VLM/AIGC模型的基本原理,有训练或推理加速经验尤佳
  • 问题解决和团队协作能力:能够独立分析和解决复杂技术问题,与多团队高效沟通

申请策略

  • 提前了解字节跳动电商业务和TikTok Shop的AI应用场景,在面试中展示业务理解
  • 准备一个完整的项目复盘,从问题定义、技术方案到最终效果的完整叙述
  • 突出分布式训练相关项目经验,如使用DeepSpeed/Megatron等框架调优的具体案例
  • 强调对大模型(LLM/VLM)的训练或推理优化成果,并附上性能提升数据
  • 展示熟练掌握的编程语言和框架,如有CUDA优化经验或底层通信优化经验,务必突出
  • 体现与算法团队协作、推动项目落地的能力
  • 巩固CUDA编程和GPU架构知识,尝试编写简单的kernel优化
  • 深入学习FSDP、DeepSpeed、Megatron等分布式训练框架的源码和原理

面试指南

  • STAR法则:先说明项目背景(Situation/Task),再讲你采取的行动(Action),最后量化结果(Result)
  • 对比法:在比较不同方案时,从原理、适用场景、性能表现三方面展开,展示思考深度
  • 问题导向:先明确问题定义和约束条件,再给出多方案权衡和最终选择
  • 请介绍一个你做过的大模型训练优化项目,遇到的最大瓶颈和解决方案是什么?
  • 解释模型并行与数据并行的区别,以及在什么场景下选择哪种并行策略?
  • 如何设计一个高效的分布式训练集群?有遇过通信瓶颈吗?如何调优?
  • 你熟悉哪些分布式训练框架?比较一下DeepSpeed和Megatron的优缺点?
  • 在电商场景下,如何评估和优化LLM模型的训练成本与效果?

职位点评

79
综合评分

大厂核心AI训练岗,前沿技术栈,薪资高,成长快,但WLB需自求多福。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术前沿、渴望高速成长和丰厚回报的求职者,能接受快节奏工作。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活60
使命价值70

薪资福利

85较高

大厂AI核心岗位,薪资水平高于市场平均,且字节福利完善,但JD未明确具体薪酬,需面议。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

90较高

职位聚焦LLM/VLM/AIGC训练优化,处于AI最前沿赛道,技术挑战大,成长速度极快。

技术前沿前沿/新兴技术
技术栈LLM、VLM、AIGC、分布式训练、CUDA、PyTorch、DeepSpeed、Megatron
业务类型profit_center

工作生活

60中等

工作地点北京,未提及灵活办公或加班情况,大厂通常节奏较快,WLB存在不确定性。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

电商AI业务直接创造商业价值,但社会意义中性,更多是技术驱动和业务增长驱动。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs