
哔哩哔哩
内容理解算法工程师【2027届】
内容理解算法工程师【2027届】
发布于 大约 2 小时前普通员工/个人贡献者
上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Dapo
Grpo
Llama-Factory
Rag
Sft
多模态大模型
大语言模型
强化学习
AI 估算 · 20k–35k
面向2027届校招,大模型方向热门,薪资竞争力较强,综合B站平台与行业水平估算。
职位详情
关于这个职位
面向2027届毕业生,在B站负责内容理解算法工作,基于多模态大模型与LLM,运用SFT、强化学习等后训练技术优化模型在内容标签、语义向量等任务上的效果,并完成落地迭代
你将参与大模型微调、RL对齐、Agent应用及训推工程,与团队共同推动AI能力在真实业务场景中的价值实现
最低要求
届本科及以上学历,具备扎实的机器学习、深度学习和编程基础
是 AI 的深度使用者,能够将大模型融入日常学习和研发工作
能够结合 Prompt、Agent、RAG、代码生成等能力解决实际问题,并验证结果的正确性
对 AI 前沿技术保持敏感,能够快速理解、动手验证并形成自己的判断
不满足于复现现有方案,愿意主动发现问题并持续推进
相比掌握多少技术名词,我们更关注你能否驾驭 AI、保持独立判断,并把技术转化为高价值结果
工作职责
大模型监督微调与迭代:基于业务真实数据与线上反馈,设计、实现 LLM / 多模态模型 SFT 微调方案
面向分类、信息抽取、内容理解、开放式生成等任务,持续提升模型效果与泛化能力
强化学习对齐算法落地:参与强化学习后训练全流程,包括 GRPO、DAPO、GSPO 等算法实践
根据业务场景设计偏好数据、打分器 / 奖励函数,优化采样策略、优势估计、KL 约束,提升模型对齐效果与训练稳定性
Agent 应用:搭建 Agent 能力解决复杂内容理解任务,在内容理解平台上实现工具调用、多轮反思,赋能智能标注等,支持产品/运营完成内容理解效果调研
训推工程和部署上线:基于 LLaMA-Factory、EasyR1、Verl 等训练框架完成数据流水线、训练配置、实验管理与复现
与数据、产品、工程团队协作,建立“数据—训练—评估—上线—反馈”的闭环体系
优先资格
有推荐、NLP、多模态、大模型、科研竞赛或高质量项目经验者优先
熟练使用 AI agent 能力者优先
AI 洞察
优缺点分析
优点
- 技术前沿,接触大模型SFT、强化学习、Agent等最新领域,成长快
- 业务场景丰富,真实大规模数据,算法落地价值明显
- 公司平台大,B站上市企业,校招体系完善
- 团队方向核心,算法位置重要,个人影响力容易体现
- 技术难度高,需要扎实的ML基础和快速学习能力
- 业务迭代快,工程链路长,可能需要较强的主观能动性
- 大模型领域竞争激烈,需保持持续学习的状态
- 适合对AI技术有浓厚兴趣、喜欢钻研前沿算法、乐于在真实业务场景中验证技术价值的应届生
缺点 / 挑战
暂无明显挑战项
角色解读
- 从算法工程师起步,逐步深入大模型后训练和内容理解垂直领域,成为技术专家
- 有机会参与核心业务算法架构设计,向技术管理或资深算法方向进阶
- 依托B站海量内容场景,积累多模态理解、AIGC等前沿领域实战经验
- 负责B站内容理解业务,针对视频、评论、弹幕等多模态内容进行理解和建模
- 设计并实施大模型SFT、强化学习等后训练方案,提升模型在内容标签、语义向量等任务上的效果
- 搭建Agent能力解决复杂内容理解任务,实现工具调用和多轮反思,支持智能标注
- 与数据、产品、工程团队协作,完成训练、评估、上线和反馈的闭环迭代
- 扎实的机器学习、深度学习和编程基础,熟悉Python等常用语言
- 熟悉大模型后训练技术,如SFT、RLHF、强化学习算法(GRPO等)
- 具备使用Agent、RAG、Prompt等能力解决实际问题的经验
- 对AI前沿技术保持敏感,能够快速验证和迭代
申请策略
- 了解B站内容理解业务,思考算法如何应用到弹幕、评论等场景
- 在简历中体现对技术的热情和快速学习能力,而不仅仅是罗列技能
- 突出机器学习/深度学习项目经历,尤其是与大模型相关的实习或科研
- 强调使用Agent、RAG、Prompt等工具解决实际问题的经验
- 如果有竞赛、开源项目、高质量论文,重点标注
- 展示独立思考和解决问题的能力,例如自动化工作流或技术博客
- 提前学习LLM微调框架(如LLaMA-Factory)和强化学习算法(如GRPO)
- 多动手实践Agent构建,熟悉主流Agent框架
面试指南
- 对于项目介绍:采用STAR法则,突出个人贡献和结果
- 对于算法原理:先讲动机和核心思想,再对比相关方法,最后结合实际应用
- 对于业务理解:结合B站场景,提出具体的模型设计和评估方案
- 介绍一下你参与过的机器学习项目,遇到的最大挑战是什么?
- 请说明SFT和RLHF的区别,以及你如何设计偏好数据?
- 如何用Agent解决一个复杂的内容理解任务?
- 你对GRPO算法有哪些了解?它相比PPO有哪些改进?
- 如何评估一个内容标签模型的效果?
职位点评
70
综合评分
大厂校招算法岗,前沿大模型技术,薪资有竞争力但工作强度未知,WLB情况不明确。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求技术成长、对AI前沿有热情、愿意深入业务场景的应届生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活50
使命价值60
薪资福利
65中等
薪资未在JD中披露,但作为上市大厂校招算法岗,薪资福利具有市场竞争力,但具体待遇需面议。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
90较高
职位处于AI前沿技术领域,涉及大模型后训练、强化学习等热门方向,技术成长空间巨大。
技术前沿前沿/新兴技术
技术栈多模态大模型、大语言模型、SFT、强化学习、GRPO、DAPO、Agent、RAG、LLaMA-Factory
业务类型ambiguous
工作生活
50较低
工作地点为上海现场办公,JD未提及弹性工作或远程政策,生活平衡情况不明。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
工作围绕内容理解,对B站业务有直接价值,但社会影响中性,行业前景向好。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs