Agora logo
声网
文本大模型算法工程师

文本大模型算法工程师

发布于 大约 3 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
NLP工程
Deepspeed
Dpo
Grpo
Rag
Rlhf
Sft
后训练
大模型
对话系统

AI 估算 · 35k–55k

上海高级算法工程师市场水平,大模型方向热门,声网上市企业薪资有竞争力

职位详情

关于这个职位

这个职位主要负责对话式AI场景下文本大模型的后训练、微调和定制化优化,通过CPT/SFT/DPO/RLHF等技术提升模型在实时音视频交互中的理解和表达能力

你将参与从数据构建、模型训练到效果评测的完整闭环,并跟踪前沿开源模型,推动算法落地到产品中
适合对大模型训练有深入理解、动手能力强且对对话交互感兴趣的算法工程师

最低要求

深入理解大模型后训练全链路(CPT/SFT/DPO/RLHF/GRPO/Agentic-RL),熟悉Reranker、向量数据库、Agent记忆与自进化机制

具备模型训练、微调、推理、评测、部署全流程能力,能独立完成数据管线建设与评测工程闭环
善于拆解业务问题,设计可验证实验方案,推动算法能力接入生产环境

工作职责

围绕声网对话式AI服务的电话呼叫、社交、陪伴、教育等场景,基于开源大模型持续提升对话智能

聚焦后训练与强化学习,系统提升模型在垂直对话场景中的理解、推理与表达能力
负责从训练、评测到上线的完整闭环,包括数据方案设计、模型调优、效果评估、问题诊断与性能优化
研究并跟踪主流开源模型与训练方法,评估其业务适用性,推动模型能力落地到产品与客户场景
与产品、工程、业务团队协作,建立开源模型向业务场景快速适配的标准流程

优先资格

对话式AI、语音助手、智能客服等交互类产品经验

Agent工具调用、工作流编排、多轮对话管理经验
RAG系统完整落地经验,熟悉知识库构建、检索优化、重排序、上下文压缩
熟悉主流训练推理框架(如vLLM、DeepSpeed、Megatron、LLaMA-Factory等)
低延迟、高并发、成本优化相关经验
ACL/EMNLP/NeurIPS/ICML/ICLR发表论文,或高质量开源项目贡献
创业公司经历

AI 洞察

优缺点分析

优点

  • 大模型方向是当前AI领域最热门的赛道,技能积累价值高,职业前景广阔
  • 声网作为实时音视频领域的上市公司,有丰富的对话场景数据和落地需求,能接触到真实大规模交互系统
  • 工作内容覆盖训练、评测、部署全流程,属于端到端的技术岗位,成长空间大
  • 团队技术氛围浓厚,有机会与业界顶尖人才合作,并可发表论文或参与开源项目
  • 对话场景复杂,模型需要处理多轮对话、意图识别、记忆管理等难点,技术难度大
  • 适合对大模型训练有深厚热情、动手能力强、善于解决实际问题的算法工程师,尤其对对话AI和强化学习感兴趣者

缺点 / 挑战

  • 大模型训练对GPU算力要求高,需要应对成本优化和资源调配的挑战
  • 行业竞争激烈,需要持续跟踪最新论文和技术,保持学习压力较大

角色解读

  • 从模型调优工程师成长为对话AI架构师,主导整个对话系统的设计与优化
  • 向技术专家方向发展,深耕强化学习、多智能体等领域,成为行业顶尖人才
  • 可转向产品经理或技术管理岗位,结合业务理解推动AI产品规模化落地
  • 使用CPT、SFT、DPO、RLHF等后训练技术对开源大模型进行微调,提升其在对话场景中的理解和生成能力
  • 设计并实施模型评测方案,从数据构建到上线部署形成完整闭环,确保模型效果和性能
  • 跟踪前沿开源模型与训练方法(如vLLM、DeepSpeed),评估业务适用性并推动落地
  • 与产品和工程团队协作,将模型能力快速适配到电话呼叫、社交、陪伴等具体场景
  • 深入理解大模型后训练全链路,包括CPT、SFT、DPO、RLHF、GRPO等算法原理和实践经验
  • 熟练使用主流训练推理框架,如vLLM、DeepSpeed、Megatron、LLaMA-Factory等
  • 具备数据工程能力,能独立构建数据管道和评测工程,处理海量对话数据
  • 熟悉RAG、Agent、向量数据库等相关技术,有对话式AI产品经验者优先

申请策略

  • 提前了解声网的对话AI业务方向(电话呼叫、社交、陪伴、教育等),在面试中展示对场景的理解
  • 准备一个完整的项目复盘案例,展示从问题定义、方案设计到效果评估的思考过程
  • 突出大模型后训练项目经验,特别是CPT、SFT、DPO、RLHF等具体方法的应用成果
  • 展示完整的模型训练、评测、部署闭环案例,强调独立解决技术难题的能力
  • 如果有对话系统、智能客服或RAG相关经验,务必详细描述
  • 强调工程能力,如使用DeepSpeed、vLLM等框架的经验和性能优化成果
  • 系统学习强化学习(RLHF、GRPO)和Agent相关技术,弥补知识短板
  • 熟悉至少一种主流训练推理框架(如vLLM、DeepSpeed),并动手复现经典论文

面试指南

  • 使用STAR法则回答项目经验:情境(Situation)、任务(Task)、行动(Action)、结果(Result),突出技术选型和量化成果
  • 对于比较类问题,先解释各自原理,再对比适用场景,最后给出自己的选择和建议
  • 对于开放设计题,先明确约束条件,再分步骤提出方案,并分析利弊
  • 请详细描述你做过的一个大模型后训练项目,包括数据来源、训练方法、效果评估及遇到的挑战
  • 比较DPO和RLHF的异同?在什么场景下你会选择哪种方法?
  • 如何设计一个针对多轮对话场景的模型评测体系?
  • 在低延迟(如实时通话)场景下,如何优化大模型的推理性能?
  • 如果使用开源模型进行领域微调后,出现灾难性遗忘怎么办?

职位点评

75
综合评分

前沿大模型算法岗,技术成长极高,薪资中上,WLB一般,适合技术热情驱动的人。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿方向的学习型人才,愿意在技术深度上投入时间,对薪资和WLB要求相对灵活。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活50
使命价值70

薪资福利

75中等

该职位薪资在上海市场属于中上水平(35k-55k/月),且声网为上市公司,福利体系完善,补偿性动机满足度较好。

薪资信号未披露(AI估算:35K-55K/月)

成长发展

95较高

大模型后训练是前沿技术方向,岗位涉及全链路技术栈,成长空间极大,发展性动机非常高。

技术前沿前沿/新兴技术
技术栈大模型、CPT、SFT、DPO、RLHF、GRPO、Agentic-RL、RAG、DeepSpeed、vLLM
成长机会持续提升、研究并跟踪主流开源模型、推动模型能力落地
业务类型profit_center

工作生活

50较低

职位要求现场办公,且大模型训练通常需要高强度投入,WLB信号未提及,生活化动机满足度一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

对话AI在社交、教育等场景有正向社会价值,但岗位描述更偏技术实现,使命感信号不强,意义感动机满足度中等偏上。

行业发展高速增长赛道
社会影响中性/一般
使命信号提升对话智能、打造善解人意且言深意切的对话模型
创新程度积极采用新技术
Watch Jobs