普通员工/个人贡献者
AI 估算 · 50k–80k
该职位负责大语言模型的后训练全流程研发,包括SFT、RLHF、DPO等对齐算法的落地与优化,并专注于提升模型在Agent场景下的能力
精通大语言模型后训练相关技术,深入理解SFT、RLHF、DPO、GRPO、Agentic RLHF等主流对齐算法的原理与工程实现,有相关项目落地经验
负责大语言模型的后训练全流程研发,包括SFT、RLHF、DPO、GRPO等主流后训练算法的落地与优化,提升模型在特定场景下的效果与对齐度
暂无 AI 洞察数据