企业微信-大模型训练框架开发工程师-AI Infra(成都/北京)
Tencent Technology (Shenzhen) Co., Ltd.
广州Posted Aug 11, 2026via generic-json
1.负责大模型训练/推理场景下的性能分析与优化,重点优化 NVIDIA GPU 及 国产芯片 的计算、显存、通信和调度瓶颈;
2.负责 CUDA / Triton / C++ 高性能算子开发与优化,包括 GEMM、Attention、MoE、KV Cache、通信融合等方向;
3.负责多卡、多机训练/推理性能调优,优化 NCCL、NVLink、NVSwitch、InfiniBand/RDMA 等通信链路;
4.负责基于 NVIDIA GPU 和 国产芯加速卡 的性能调优,提升 GPU 利用率、吞吐、延迟和显存效率;
5.负责 PyTorch、TensorRT-LLM、vLLM、SGLang、Megatron-LM 等框架下的大模型性能优化落地;
6.结合 Nsight Systems、Nsight Compute、CUDA Profiler 等工具进行性能分析,定位并解决性能瓶颈。
Source URL: http://careers.tencent.com/jobdesc.html?postId=1976128424510644224