iFLYTEK logo
科大讯飞
【星火X计划】高可信低幻觉大模型技术研究(J13811)

【星火X计划】高可信低幻觉大模型技术研究(J13811)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市
无经验要求
全职员工
仅现场办公
博士
机器学习工程
Grpo
Mcts
Megatron
Prm
Pytorch
Rlhf
Vllm
大模型
强化学习

AI 估算 · 30k–45k

顶尖AI博士研究岗,技术门槛高,市场竞争激烈,薪酬高于普通岗位,合肥生活成本较低。

职位详情

关于这个职位

这是科大讯飞星火X计划中的高可信低幻觉大模型技术研究岗位,聚焦大模型在复杂推理任务中的准确度与可信度问题,通过PRM过程监督、Harness推理搜索等前沿技术,解决强化学习奖励稀疏和模型幻觉等核心挑战

适合对AI研究充满热情、有志于在学术和工业界产出顶级成果的博士人才

最低要求

-27届博士毕业生,人工智能、计算机科学、强化学习、深度学习、自然语言处理、应用数学等相关专业,具备良好的科研素养与前沿研究视野

理论功底扎实,精通大模型基础理论,深入理解强化学习(GRPO、PPO等)与奖励模型(RM)核心机制
具备优秀的独立科研攻关与复杂问题拆解能力,能够精准挖掘大模型推理准确度与可信度提升过程中的技术瓶颈,独立完成原创算法方案设计、数据合成管线搭建与大规模强化学习实验验证,具备较强的技术问题复盘思维
拥有扎实的数理推导、算法建模与实验设计能力
具备良好的工程实操能力,熟练使用PyTorch及主流大模型训练/推理框架(如Megatron、vLLM、DeepSpeed、VeRL或OpenRLHF等),熟悉RL分布式训练、显存优化及推理加速方案
具备良好的跨团队协作能力,可协同预训练、工程加速及业务落地团队推进推理优化技术的迭代,抗压能力强,能够紧跟工业级前沿算法研发节奏

工作职责

【课题介绍】本课题聚焦大模型在复杂推理任务(如数学推导、代码生成、步骤批改等)中准确度不足、存在幻觉与逻辑跳跃的核心难题

针对当前大模型强化学习中基于结果监督(ORM)存在的奖励稀疏、信用分配困难等技术瓶颈,围绕基于Harness的生成策略优化、过程监督奖励模型(PRM)强化学习、以及推理期算力扩展三大核心主线,开展高可靠、强逻辑推理能力的融合优化建模研究
【课题挑战】1、长程推理的隐式信用分配与过程建模难题:在长链路推理场景下,关键步骤的信用分配极具挑战
需打破传统PRM重度依赖Step-by-step显式人工标注的技术桎梏,探索隐式信用分配与过程建模机制
通过挖掘推理轨迹内部的状态特性,自适应定位对最终结果起决定性作用的关键Token或节点,实现稀疏全局奖励向局部核心步骤的精准映射,建立更具本质泛化能力的细粒度奖励范式
强化学习中的奖励稀疏与Reward Hacking冲突:在长链路推理中,探索如何利用PRM提供密集且稳定的奖励信号,优化PPO/GRPO等RL算法的价值估计与策略更新机制,同时规避模型在细粒度奖励下产生的捷径优化与奖励破解问题
高可靠Harness架构设计与全维度评测缺失难题:现有评测往往仅关注最终结果的静态匹配,难以支撑长程推理中的过程干预与状态追踪
需从算法与架构底层设计具备强扩展性的自动化推理验证基座
并以此为基础,构建覆盖逻辑连贯性、错误探知率及输出可信度的全维度评测体系,为大模型推理能力的迭代验证提供严谨的闭环支撑
推理期算力扩展的效能平衡难题:在复杂推理任务中,通过扩展推理期算力以提升生成质量,极易引发计算与显存开销的急剧膨胀,并伴随边际效用递减
需深入探索动态算力分配、自适应剪枝与提前终止等机制,解决不同任务复杂度下算力投入与推理准确度之间的有效性转化问题,实现“生成效率与推理精度”的最优平衡
【课题价值】1、技术创新价值:突破传统结果监督RLHF的技术瓶颈,首创适配复杂逻辑任务的PRM过程监督与Harness推理搜索融合范式,有效化解强化学习奖励稀疏难题,填补行业在高可靠长链路推理机制上的技术空白
工程落地价值:打通“PRM训练 - RL策略优化 - 复杂推理搜索加速”的全链路工程栈,构建适配生产环境的高效Harness推理工具链,支撑自研大模型在数学、代码、Agent决策等核心场景的规模化部署
业务赋能价值:显著提升大模型在严肃商业场景中的可信度与准确率,解决逻辑断层、过程幻觉、无法自我纠错的业务痛点,大幅扩展大模型在金融推理、自动编程、复杂科研助手等高壁垒场景的业务边界
技术壁垒价值:形成完整的过程监督奖励建模、推理期搜索强化技术体系,产出ICLR、NeurIPS等高水平顶会论文,沉淀高质量逻辑推理数据集与专利,夯实公司在AGI复杂推理领域的行业技术壁垒与学术影响力

优先资格

对过程监督(PRM)、搜索解码(MCTS等)及解决强化学习奖励稀疏问题有深入研究者优先

有ICLR、NeurIPS、ICML、ACL等顶会在强化学习、大模型推理、对齐技术、Harness相关论文发表或录用经历优先
具备大模型后训练或复杂Harness框架开发经验者优先

AI 洞察

优缺点分析

优点

  • 技术前沿,聚焦大模型可信推理,是人工智能领域最热方向之一,有广阔发展前景
  • 公司为AI龙头企业,提供充足算力资源和数据支持,适合开展高质量研究
  • 有发表顶会论文和申请专利的机会,能快速提升个人学术价值
  • 薪酬福利有竞争力,博士人才计划待遇优厚
  • 工作强度较大,需要抗压能力强、能紧跟工业级研发节奏
  • 竞争激烈,需持续学习最新技术,保持前沿视野
  • 适合对科研充满热情、具备扎实AI理论功底、志在攻克大模型技术难题的博士毕业生

缺点 / 挑战

  • 课题难度极高,需要在奖励稀疏、过程监督等瓶颈问题上实现创新突破

角色解读

  • 在顶尖AI研究团队中成长为技术专家,主导核心课题攻关
  • 通过产出ICLR、NeurIPS等顶会论文和专利,提升学术影响力与行业认可度
  • 未来可向技术管理或首席科学家方向发展,引领大模型可信推理领域
  • 研究大模型在数学、代码等复杂推理任务中的准确度与幻觉问题,设计并实现高可靠性的推理优化算法
  • 构建过程监督奖励模型(PRM)和强化学习训练框架,优化模型的长链路推理与自我纠错能力
  • 开发基于Harness的推理搜索与自适应机制(如结合PRM的MCTS),提升模型的推理效率和可信度
  • 精通大模型基础理论与强化学习算法(GRPO、PPO等)
  • 深入理解奖励模型(RM)与过程监督(PRM)机制,熟悉推理搜索算法(如MCTS)
  • 熟练使用PyTorch及主流大模型训练/推理框架(Megatron、vLLM等),具备分布式训练经验
  • 扎实的数理推导与算法设计能力,能够独立完成实验验证和问题复盘

申请策略

  • 关注科大讯飞星火大模型的研发动态,了解其技术方向
  • 准备一个与你研究相关的课题介绍,展示你的技术深度和创意
  • 突出博士期间在强化学习、大模型推理等方向的研究项目和成果
  • 列出顶会论文发表记录,特别是ICLR、NeurIPS、ACL等
  • 强调熟悉PRM、MCTS、GRPO等技术的实际项目经验
  • 展示工程实现能力,如使用PyTorch进行大规模模型训练或推理框架开发
  • 深入理解强化学算法(PPO/GRPO)的原理与实现,关注奖励模型最新进展
  • 学习MCTS和过程监督相关前沿论文,并尝试复现部分实验

面试指南

  • 用STAR法则(情境-任务-行动-结果)结构化描述项目经历,突出你的贡献和成果
  • 技术问题遵循“定义问题-分析难点-提出方法-实验验证”的逻辑进行回答
  • 结合前沿论文和你自己的思考,展示对底层原理的深刻理解
  • 请详细介绍你在强化学习或大模型推理方面的研究经历,并说明解决了哪些关键问题
  • 你如何看待结果监督(ORM)与过程监督(PRM)的优缺点?如何解决奖励稀疏问题?
  • 你了解MCTS吗?请描述如何将MCTS与PRM结合用于推理优化
  • 你对Harness框架有什么理解?在推理中如何实现自我校验与回溯?
  • 复习强化学习和Transformer架构的基础知识,熟悉最新前沿论文

职位点评

78
综合评分

顶尖AI研究岗,前沿技术,成长极好,但强度高,WLB不确定。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求技术前沿、热爱科研、愿意在学术和工程上接受挑战的博士人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活60
使命价值90

薪资福利

70中等

薪资未披露但预期较高,公司为上市大企业,稳定性好,但福利细节不明确。

薪资信号未披露(AI估算:30K-45K/月)

成长发展

90较高

前沿技术研究,成长空间巨大,有顶会论文产出机会,符合博士人才对学术和职业发展的需求。

技术前沿前沿/新兴技术
技术栈大模型、强化学习、PRM、MCTS、PyTorch、GRPO、PPO、RLHF、Megatron、vLLM
成长机会产出ICLR、NeurIPS等高水平顶会论文
业务类型ambiguous

工作生活

60中等

工作地点在合肥,生活压力小,但工作强度可能较高,JD未提WLB安排。

工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词

使命价值

90较高

课题解决大模型可信度问题,行业价值高,技术革新意义重大,符合科技报国使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号突破传统结果监督RLHF的技术瓶颈、填补行业高可靠长链路推理机制上的技术空白
创新程度开拓性创新(行业首创)
Watch Jobs