年以上 AI 系统或推理引擎开发经验,深度参与过至少一个端侧推理框架的核心模块设计(ONNX Runtime / MNN / NCNN / MLX / llama.cpp / ExecuTorch)
精通 C++17 及以上版本,具备扎实的多线程与高并发编程能力,熟悉并发队列、无锁/低锁设计、锁竞争分析与性能优化 深入理解大模型推理的核心瓶颈,能够从显存带宽、计算能力、PCIe 传输、CPU-GPU 页交换等维度定位性能问题,理解 Prefill 与 Decode 阶段在计算密集、访存密集及并行特征上的差异 有生产环境端侧模型部署经验,熟悉模型转换工具链(ONNX / CoreML / TFLite / MLC-LLM) 深入掌握 KV-Cache 底层原理及工程实现,熟悉 PagedAttention、逻辑块与物理块管理、页表映射、显存池等关键机制,能够针对长上下文和高并发场景优化缓存利用率 熟悉大模型推理请求调度策略,包括连续批处理(Continuous Batching)、动态批处理、预取与请求抢占,能够在吞吐、时延、公平性和资源利用率之间进行系统性权衡 具备 GPU 显存管理与优化经验,熟悉显存池化、显存碎片治理、CPU-GPU 页交换与 Offload 机制,能够设计受限算力和受限内存设备上的模型装载与运行方案 熟悉推理服务性能度量与调优方法,能够围绕吞吐量(TPS)、首 Token 时延(TTFT)、单 Token 解码时延(TPOT)建立基准测试、性能剖析和持续优化体系