关注我们
学术桥订阅号
学术桥-订阅号
学术桥小程序
学术桥-小程序

AI算力运维工程师

面议
北京
本科
行政职能岗
北京大学健康医疗大数据国家研究院
立即投递
职位介绍
科研经费
福利奖金
高额年薪
紧缺人才
紧缺专业
软件工程
电子信息
专业要求
健康医疗大数据
学科方向
软件工程、电子信息

研究方向

健康医疗大数据


工作经验要求

1-3年


岗位职责

1.负责健康医疗大数据平台GPU/CPU科研计算集群的建设、运行和维护;
2.负责基于Slurm等技术的算力资源统一调度、用户管理、任务管理和资源配额管理;
3.负责NVIDIA GPU、CUDA、cuDNN、NCCL及PyTorch等AI计算环境的部署和维护;
4.负责Docker/Apptainer等容器化科研计算环境建设;
5.建设GPU及服务器监控体系,实现GPU利用率、显存、任务和资源使用情况监测;
6.支持单机多卡、多机多卡及分布式AI训练任务,协助定位GPU、通信、存储及网络性能问题;
7.建立GPU-hour等算力使用统计和资源利用分析机制,提高平台整体算力利用效率;
8.为科研人员提供AI计算环境、集群任务及算力使用相关技术支持


职位要求

应聘条件:

1.计算机、软件工程、电子信息等相关专业本科及以上学历,研究生学历者优先;
2.具有1年以上Linux服务器、GPU集群、HPC或AI计算平台相关经验;
3.熟悉Slurm、PBS、LSF等至少一种集群任务调度系统(具有Slurm实际经验者优先),具备大规模集群任务调度、配额管理、资源优化实战能力;
4.熟悉NVIDIA GPU、CUDA及常见AI计算环境,熟悉NVIDIA GPU硬件架构及NVLink多卡互联机制,熟练掌握CUDA、cuDNN、NCCL底层通信环境部署与调优,熟悉RDMA/InfiniBand高速网络配置、运维及故障排查,精通PyTorch等主流AI框架的集群适配与运行优化;
5.熟悉Docker等容器技术,能够独立完成容器镜像定制、批量部署与环境封装,具备Python/Shell脚本能力;
6.了解Prometheus、Grafana等监控体系,了解DCGM GPU监控工具,可独立搭建、调试、迭代算力集群监控体系;
7.具备较强的问题定位、系统学习和沟通协作能力;优先考虑:具有NCCL、PyTorch Distributed、RDMA/InfiniBand、NVLink、MIG、Kubernetes、DCGM、JupyterHub或大型GPU集群实际运维经验


职位来源:https://rsc.bjmu.edu.cn/rczp/jfxz/5d99484ddd2045f7b3fef1bee5bbc5af.htm