
百度
Agent算法实习生(J103894)
Agent算法实习生(J103894)
发布于 大约 15 小时前实习/见习
北京市
无经验要求
实习生
仅现场办公
本科
机器学习工程
Llm Agent
强化学习
树搜索
进化算法
推理时搜索
自我改进
AI 估算 · 4k–8k
百度核心AI部门实习,前沿研究方向,薪资具有竞争力,按月发放。
职位详情
关于这个职位
该实习岗位面向对AI Agent和推理时搜索感兴趣的同学,你将参与前沿的难任务发现、搜索缩放、轨迹学习等研究,并在真实工业场景中验证方法
适合有扎实Python基础和对LLM/RL有热情的在校生
最低要求
本科及以上学历在读,计算机/数学/自动化/人工智能等相关专业优先
扎实的 Python 工程能力,有完整的算法项目、系统实现或开源经历
在以下至少一个方向有实践或研究经验:LLM Agent(harness)、Self-Improvement Agent、推理时搜索(test-time scaling)、强化学习/后训练(RLHF/RLVR/拒绝采样)、进化算法与程序搜索(AlphaEvolve/FunSearch 系)
深度关注前沿:对 agentic RL、inference-time scaling、self-improvement、benchmark 构建等方向有自己的判断
具备自驱力与系统性思考能力,对创新型研究有热情
工作职责
参与"难任务发现"研究:系统性构建与评测让前沿模型+harness 失效的任务族(长程优化、可持续迭代、强验证类问题等),建立可复现的 benchmark 与失败归因体系
探索推理时搜索的 scaling 路径:并行采样、树搜索、进化搜索、verifier 引导搜索、多 agent 协作等机制在难任务上的算力-质量曲线,寻找"多花算力就能换来好轨迹"的scaling方法结构
研究基于轨迹的学习:从搜索得到的高质量轨迹出发,探索拒绝采样蒸馏、agentic RL、自我改进循环、经验沉淀(skill/记忆)等把"搜到"变成"学会"的路径
参与 agent harness 与评测系统的设计实现
在真实工业决策场景(排产、调度、预测等)上验证方法的外部效度,推动研究结论落到可复现的系统
优先资格
有科研产出、竞赛经历或高质量开源贡献者优先
AI 洞察
优缺点分析
优点
- 前沿研究方向,接触最热门的Agent和推理时搜索技术
- 百度顶尖AI团队,学习资源丰富,导师指导专业
- 研究与应用结合,成果可落地,简历含金量高
- 有机会参与顶会论文发表,为学术或工业界铺路
- 研究难度大,需要快速学习前沿论文并复现
- 任务导向,可能需要长时间实验和调试,工作强度不低
- 对数学和算法基础要求高,竞争激烈
缺点 / 挑战
- 适合对AI前沿研究有强烈兴趣、有扎实编程和算法基础、愿意挑战难题的在校生
角色解读
- 实习生→正式研究员→项目负责人,在百度AI研究院深入发展
- 积累Agent和推理时搜索经验,进可攻AI科研,退可守工业落地
- 表现优秀可转正,参与核心算法研发,有机会发表顶会论文
- 参与构建评测体系和难任务集,用于测试前沿AI模型的极限
- 探索推理时搜索的缩放规律,研究如何通过增加算力提升模型表现
- 开发基于搜索轨迹的学习方法,将搜索成果转化为模型能力
- 在实际工业决策场景中验证研究方法的有效性
- 扎实的Python编程能力,能独立实现算法项目
- 熟悉LLM Agent或强化学习相关方向,有实践经验
- 对前沿AI研究有深度关注,能快速理解新论文
- 自驱力强,具备系统性思考和创新研究能力
申请策略
- 在简历中体现对Agent和推理时搜索的深度理解,可附上技术博客
- 提前了解百度在Agent领域的工作,如文心智能体平台
- 突出Python工程能力,附上GitHub或开源项目链接
- 强调Agent、RL或搜索相关的研究或项目经验
- 展示科研产出、竞赛获奖或高质量开源贡献
- 描述对前沿方向的独到见解或实践案例
- 复习强化学习基础,熟悉PPO、RLHF等算法
- 动手实现一个简单的Agent或搜索算法,如树搜索
面试指南
- 结合具体例子阐述概念,展示对前沿论文的理解
- 从目标、方法、评估三个维度系统回答,体现设计思维
- 强调实验设计和失败分析,展示研究严谨性
- 请解释一下什么是推理时搜索,以及它为什么重要?
- 你如何设计一个Benchmark来测试Agent的推理能力?
- 简述一种你熟悉的强化学习算法,并说明其在Agent中的应用
- 给定一个任务,如何构建搜索空间并定义奖励函数?
- 你如何看待self-improvement在Agent中的潜力?
职位点评
66
综合评分
百度AI前沿研究实习,技术成长极快,但WLB一般。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合以技术成长为首要目标、能接受高强度研究的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展95
工作生活40
使命价值80
薪资福利
55较低
实习薪资在行业中上水平,但作为实习缺少长期福利保障,整体补偿性一般。
薪资信号面议 (4K-8K/月)
成长发展
95较高
职位涉及最前沿的AI研究方向,技能成长空间极大,且百度平台资源丰富,发展性极强。
技术前沿前沿/新兴技术
技术栈LLM Agent、推理时搜索、强化学习、进化算法、自改进
业务类型profit_center
工作生活
40较低
现场办公且研究强度大,工作节奏可能较快,生活化动机满足程度较低。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
80较高
推动AI前沿发展,解决难任务问题,社会意义较大,且行业处于高速增长期。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
百度 的其他在招职位
相似职位推荐
Watch Jobs