微信 -WeLM 大模型推理优化工程师(深圳、上海)
Tencent Technology (Shenzhen) Co., Ltd.
北京Posted Aug 11, 2026via generic-json
1. 模型推理服务优化:
* 负责大语言模型(LLM)推理性能的优化,包括延迟降低、吞吐量提升和资源效率优化
* 开发和应用模型压缩技术(包括但不限于量化、稀疏化等)
* 优化推理框架,支持多种硬件平台(GPU、专用AI芯片)
* 设计并实现高效、稳定、可扩展的推理服务架构
2. 性能分析与调优:
* 建立性能基准测试框架,持续监控和评估推理性能
* 分析性能瓶颈,提出并实施优化方案
* 针对不同应用场景(实时对话、批量处理等)定制优化策略
3. 技术创新与落地:
* 跟踪最新研究成果,将前沿优化技术应用到生产环境
* 与算法团队合作,参与模型架构的推理友好设计
* 编写高质量的技术文档和最佳实践指南
Source URL: http://careers.tencent.com/jobdesc.html?postId=2020723060671414272