熟练掌握 C/C++、Python语言,有计算机体系结构背景或软件开发背景,熟悉系统性能调优的方式
具备基础的GPU编程能力,包括但不限于Cuda、OpenCL,熟悉至少一种GPU加速库,如cublas、cudnn、cutlass等
具备Tensorrt/FasterTransformer/Tensorrt-llm/vllm/sglang等推理引擎的使用和性能优化经验
熟悉各类深度学习网络和算子底层实现细节,具备训推模型调试、调优实操经验优先
熟悉CPU/GPU异构加速瓶颈分析方法,有服务器端 AI 芯片、GPU加速经验优先
熟悉分布式推理常用加速方法,有超大模型分布式部署经验优先