
声网
文本大模型算法工程师
文本大模型算法工程师
发布于 大约 3 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
学历未注明
NLP工程
Deepspeed
Dpo
Grpo
Rag
Rlhf
Sft
后训练
大模型
对话系统
AI 估算 · 35k–55k
上海高级算法工程师市场水平,大模型方向热门,声网上市企业薪资有竞争力
职位详情
关于这个职位
这个职位主要负责对话式AI场景下文本大模型的后训练、微调和定制化优化,通过CPT/SFT/DPO/RLHF等技术提升模型在实时音视频交互中的理解和表达能力
你将参与从数据构建、模型训练到效果评测的完整闭环,并跟踪前沿开源模型,推动算法落地到产品中
适合对大模型训练有深入理解、动手能力强且对对话交互感兴趣的算法工程师
最低要求
深入理解大模型后训练全链路(CPT/SFT/DPO/RLHF/GRPO/Agentic-RL),熟悉Reranker、向量数据库、Agent记忆与自进化机制
具备模型训练、微调、推理、评测、部署全流程能力,能独立完成数据管线建设与评测工程闭环
善于拆解业务问题,设计可验证实验方案,推动算法能力接入生产环境
工作职责
围绕声网对话式AI服务的电话呼叫、社交、陪伴、教育等场景,基于开源大模型持续提升对话智能
聚焦后训练与强化学习,系统提升模型在垂直对话场景中的理解、推理与表达能力
负责从训练、评测到上线的完整闭环,包括数据方案设计、模型调优、效果评估、问题诊断与性能优化
研究并跟踪主流开源模型与训练方法,评估其业务适用性,推动模型能力落地到产品与客户场景
与产品、工程、业务团队协作,建立开源模型向业务场景快速适配的标准流程
优先资格
对话式AI、语音助手、智能客服等交互类产品经验
Agent工具调用、工作流编排、多轮对话管理经验
RAG系统完整落地经验,熟悉知识库构建、检索优化、重排序、上下文压缩
熟悉主流训练推理框架(如vLLM、DeepSpeed、Megatron、LLaMA-Factory等)
低延迟、高并发、成本优化相关经验
ACL/EMNLP/NeurIPS/ICML/ICLR发表论文,或高质量开源项目贡献
创业公司经历
AI 洞察
优缺点分析
优点
- 大模型方向是当前AI领域最热门的赛道,技能积累价值高,职业前景广阔
- 声网作为实时音视频领域的上市公司,有丰富的对话场景数据和落地需求,能接触到真实大规模交互系统
- 工作内容覆盖训练、评测、部署全流程,属于端到端的技术岗位,成长空间大
- 团队技术氛围浓厚,有机会与业界顶尖人才合作,并可发表论文或参与开源项目
- 对话场景复杂,模型需要处理多轮对话、意图识别、记忆管理等难点,技术难度大
- 适合对大模型训练有深厚热情、动手能力强、善于解决实际问题的算法工程师,尤其对对话AI和强化学习感兴趣者
缺点 / 挑战
- 大模型训练对GPU算力要求高,需要应对成本优化和资源调配的挑战
- 行业竞争激烈,需要持续跟踪最新论文和技术,保持学习压力较大
角色解读
- 从模型调优工程师成长为对话AI架构师,主导整个对话系统的设计与优化
- 向技术专家方向发展,深耕强化学习、多智能体等领域,成为行业顶尖人才
- 可转向产品经理或技术管理岗位,结合业务理解推动AI产品规模化落地
- 使用CPT、SFT、DPO、RLHF等后训练技术对开源大模型进行微调,提升其在对话场景中的理解和生成能力
- 设计并实施模型评测方案,从数据构建到上线部署形成完整闭环,确保模型效果和性能
- 跟踪前沿开源模型与训练方法(如vLLM、DeepSpeed),评估业务适用性并推动落地
- 与产品和工程团队协作,将模型能力快速适配到电话呼叫、社交、陪伴等具体场景
- 深入理解大模型后训练全链路,包括CPT、SFT、DPO、RLHF、GRPO等算法原理和实践经验
- 熟练使用主流训练推理框架,如vLLM、DeepSpeed、Megatron、LLaMA-Factory等
- 具备数据工程能力,能独立构建数据管道和评测工程,处理海量对话数据
- 熟悉RAG、Agent、向量数据库等相关技术,有对话式AI产品经验者优先
申请策略
- 提前了解声网的对话AI业务方向(电话呼叫、社交、陪伴、教育等),在面试中展示对场景的理解
- 准备一个完整的项目复盘案例,展示从问题定义、方案设计到效果评估的思考过程
- 突出大模型后训练项目经验,特别是CPT、SFT、DPO、RLHF等具体方法的应用成果
- 展示完整的模型训练、评测、部署闭环案例,强调独立解决技术难题的能力
- 如果有对话系统、智能客服或RAG相关经验,务必详细描述
- 强调工程能力,如使用DeepSpeed、vLLM等框架的经验和性能优化成果
- 系统学习强化学习(RLHF、GRPO)和Agent相关技术,弥补知识短板
- 熟悉至少一种主流训练推理框架(如vLLM、DeepSpeed),并动手复现经典论文
面试指南
- 使用STAR法则回答项目经验:情境(Situation)、任务(Task)、行动(Action)、结果(Result),突出技术选型和量化成果
- 对于比较类问题,先解释各自原理,再对比适用场景,最后给出自己的选择和建议
- 对于开放设计题,先明确约束条件,再分步骤提出方案,并分析利弊
- 请详细描述你做过的一个大模型后训练项目,包括数据来源、训练方法、效果评估及遇到的挑战
- 比较DPO和RLHF的异同?在什么场景下你会选择哪种方法?
- 如何设计一个针对多轮对话场景的模型评测体系?
- 在低延迟(如实时通话)场景下,如何优化大模型的推理性能?
- 如果使用开源模型进行领域微调后,出现灾难性遗忘怎么办?
职位点评
75
综合评分
前沿大模型算法岗,技术成长极高,薪资中上,WLB一般,适合技术热情驱动的人。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和前沿方向的学习型人才,愿意在技术深度上投入时间,对薪资和WLB要求相对灵活。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活50
使命价值70
薪资福利
75中等
该职位薪资在上海市场属于中上水平(35k-55k/月),且声网为上市公司,福利体系完善,补偿性动机满足度较好。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
95较高
大模型后训练是前沿技术方向,岗位涉及全链路技术栈,成长空间极大,发展性动机非常高。
技术前沿前沿/新兴技术
技术栈大模型、CPT、SFT、DPO、RLHF、GRPO、Agentic-RL、RAG、DeepSpeed、vLLM
成长机会持续提升、研究并跟踪主流开源模型、推动模型能力落地
业务类型profit_center
工作生活
50较低
职位要求现场办公,且大模型训练通常需要高强度投入,WLB信号未提及,生活化动机满足度一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
70中等
对话AI在社交、教育等场景有正向社会价值,但岗位描述更偏技术实现,使命感信号不强,意义感动机满足度中等偏上。
行业发展高速增长赛道
社会影响中性/一般
使命信号提升对话智能、打造善解人意且言深意切的对话模型
创新程度积极采用新技术
声网 的其他在招职位
相似职位推荐
Watch Jobs