
阿里巴巴
业务技术-AI Agent 优化工程师-智能内控方向
业务技术-AI Agent 优化工程师-智能内控方向
发布于 大约 14 小时前普通员工/个人贡献者
杭州市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Ai Agent
Dpo
Nlp
Pytorch
Rag
Rlhf
Sft
大模型
AI 估算 · 25k–45k
大模型与AI Agent方向热门,技术要求高,阿里巴巴平台竞争力强,薪资处于市场偏高水平。
职位详情
关于这个职位
该职位负责阿里巴巴淘天集团智能内控体系的AI模型优化,聚焦资金风险防控、合规审计等核心场景
你将运用大模型后训练、RAG、Agent等技术构建智能内控引擎,并与业务专家协作推动AI落地
最低要求
职位要求:
硕士研究生及以上学历,计算机、人工智能、统计学、数学、金融工程等相关专业优先
年以上大模型/NLP算法研发或调优经验,精通Transformer架构原理,熟练掌握SFT、RLHF、DPO、Agentic RL等对齐训练范式
具备扎实的Agent评测能力,熟悉主流评测框架(如lm-evaluation-harness、OpenCompass、RAGAS)和常用评测benchmark,掌握BLEU/ROUGE/BERTScore/F1/AUC等指标适用边界,能独立设计面向业务的Task-Specific Evaluation Protocol
精通Python编程,熟练使用PyTorch/TensorFlow、DeepSpeed/Megatron-LM、vLLM/TGI等训练与推理框架(任意一个即可)
对数据质量敏感,掌握数据清洗、去重、配比采样、Curriculum Learning等数据工程方法论,理解数据分布偏移(Distribution Shift)对模型效果的影响
具备大数据处理能力,熟悉Spark/Flink/Hive等分布式计算框架,能够独立完成TB级日志、行为序列、交易流水等内控数据的ETL开发、特征工程与批量加工,了解数据湖仓架构(如Delta Lake/Iceberg/Hudi)及OLAP引擎(如ClickHouse/Doris/StarRocks)者优先
具备优秀的跨团队沟通能力和业务抽象能力,能将内控合规规则转化为可训练的标签体系或Reward Function
工作职责
面向资金流水、审批日志、合同文本、操作行为序列等多模态内控数据,设计并实施SFT(Supervised Fine-Tuning)、DPO/RLHF等后训练对齐方案,提升模型在内控垂域任务中的指令遵循能力与事实准确性
构建覆盖内控场景的自动化评测体系,包括但不限于:Benchmark构建、Golden Set标注、RAGAS/TruLens评估、幻觉检测(Hallucination Detection)、置信度校准(Confidence Calibration)及A/B Test框架,量化模型迭代收益
针对合规推理、风险归因、异常溯源等长链路决策任务,优化Prompt Engineering、CoT(Chain-of-Thought)、ReAct Agent架构及检索增强生成(RAG)策略,提升复杂业务问题的端到端解决率
深入分析Bad Case与Corner Case,通过LoRA/QLoRA微调、知识蒸馏(Knowledge Distillation)、数据合成(Synthetic Data Generation)等手段持续优化模型表现,平衡效果、延迟与推理成本
与内控业务专家、策略运营及工程团队紧密协作,将模糊的合规诉求转化为可量化的算法优化目标,推动AI能力在内控全流程的规模化落地
优先资格
加分项:
有企业内控、风控、审计、反舞弊或金融合规领域实际项目经验,熟悉SOX/COSO框架或电商交易风控逻辑者优先
有大型Agent项目完整评测体系落地经验者优先
在NeurIPS/ICML/ACL/EMNLP/KDD等顶会发表过Alignment、Evaluation、Agent或FinTech相关论文者优先
主导过开源大模型微调项目或在HuggingFace/OpenCompass等平台贡献过高质量数据集/评测集者优先
具备Graph Neural Network(GNN)、时序异常检测、因果推断(Causal Inference)等传统算法与大模型融合应用经验者优先
了解模型安全与可信AI(Red Teaming、Safety Alignment、Explainability)相关技术,能在合规场景中保障模型输出可控、可追溯
AI 洞察
优缺点分析
优点
- 大模型技术栈前沿,能接触到SFT、RLHF、Agent等最热门的方向,技术成长快
- 阿里巴巴淘天集团业务场景复杂,数据量大,能锻炼解决实际问题的能力
- 职位涉及内控、风控等关键业务,重要性高,职业稳定性好
- 公司平台大,资源丰富,有完善的技术基础设施和团队支持
- 技术要求非常高,需要同时掌握模型训练、评测、数据工程和业务知识,学习成本大
- 内控场景对准确性和可解释性要求严格,模型上线门槛高,需要反复调优
缺点 / 挑战
- 跨部门协作多,需要将模糊的合规需求转化为技术方案,沟通成本较高
- 适合有大模型调优或NLP算法经验,喜欢挑战复杂业务问题,愿意深耕AI在风控审计领域应用的工程师
角色解读
- 可以成长为智能内控AI方向的专家,深入业务场景,解决复杂风控、审计问题
- 向大模型算法专家或技术Leader方向发展,带领团队构建企业级AI Agent系统
- 未来可横向扩展到通用大模型应用、AI平台架构等方向,技术壁垒高
- 负责大模型在智能内控场景的微调与对齐(SFT/RLHF/DPO),提升模型指令遵循与事实准确性
- 构建自动化评测体系,包括Benchmark、Golden Set、幻觉检测、置信度校准等,量化模型收益
- 优化Prompt、CoT、ReAct Agent和RAG策略,解决合规推理、风险归因等长链路任务
- 分析Bad Case,通过LoRA/QLoRA、知识蒸馏、数据合成等持续优化模型,并与业务、工程团队协作落地
- 扎实的机器学习/NLP基础,精通Transformer架构和SFT、RLHF、DPO等后训练方法
- 熟悉Agent评测框架(如lm-evaluation-harness、RAGAS)和常用指标(BLEU、ROUGE、F1、AUC)
- 精通Python,熟练使用PyTorch、DeepSpeed、vLLM等训练推理框架
- 掌握大数据处理(Spark/Flink/Hive)和分布式计算,具备数据工程能力
申请策略
- 研究阿里巴巴淘天集团的业务方向和智能内控体系,了解其面临的挑战
- 在简历中展示对模型可信度、可解释性的关注,这与内控场景高度相关
- 突出大模型后训练(SFT/RLHF/DPO)的实际项目经验,展示迭代过程和效果指标
- 强调评测体系搭建经验,如有Benchmark或Golden Set设计案例,要详细说明
- 展示大数据处理能力,如TB级数据ETL、特征工程经验,体现工程实践能力
- 如有Agent项目或RAG应用经验,务必列出,并说明具体业务场景和优化效果
- 熟悉主流Agent评测框架(如RAGAS、lm-evaluation-harness),并动手实践
- 补充企业内控、风控基础知识,了解SOX、COSO等框架,提升业务理解
面试指南
- 使用STAR法:情境(Situation)、任务(Task)、行动(Action)、结果(Result),结构化地回答项目经历
- 对于技术方案问题,先明确目标和约束,再比较不同方法的优缺点,最后给出选择理由和预期效果
- 强调量化指标,如准确率提升多少、幻觉率降低多少,用数据说话
- 请描述一个你进行过SFT或RLHF调优的项目,遇到了哪些问题?如何解决的?
- 如何设计一个针对特定业务场景的LLM评测体系?你会选择哪些指标?
- 在RAG系统中,如何提升检索准确率和回答的置信度?
- 如何处理模型幻觉问题?特别是高风险的内控场景下有哪些策略?
- 谈谈你对Agent架构的理解,ReAct和Plan-and-Execute有何优劣?如何评估Agent效果?
职位点评
75
综合评分
阿里大厂,前沿大模型技术,薪资可观,但工作强度和生活方式需面议确认。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合重视技术成长和发展前景的求职者,尤其是对AI在风控审计领域应用感兴趣的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活55
使命价值75
薪资福利
80较高
阿里巴巴作为大厂,薪资福利在行业内具有竞争力,平台稳定性高,虽然JD未明确具体薪资,但整体补偿性较好。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
85较高
该职位处于大模型技术前沿,涉及SFT、RLHF、Agent等先进方法,技术成长空间大,虽然JD未提及晋升通道,但岗位挑战性强,发展性良好。
技术前沿前沿/新兴技术
技术栈大模型、SFT、RLHF、DPO、RAG、Agent
业务类型ambiguous
工作生活
55较低
JD未明确工作方式和加班情况,阿里巴巴通常工作强度较大,生活化方面存在不确定性,综合评估一般。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
该职位通过智能内控提升企业合规和风险管理水平,具有正向社会价值,行业前景好,能够获得一定的意义感。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号风险防控、合规
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs