北京大学健康医疗大数据国家研究院AI算力运维工程师招聘启事

北京大学健康医疗大数据国家研究院现招聘AI算力运维工程师,负责GPU/CPU集群建设维护、Slurm调度、Docker容器化及监控体系,要求本科及以上学历及1年以上相关经验。报名截止至2026年12月31日,请通过官方渠道提交中英文简历及证明材料。

信息项目

信息内容

标 题

北京大学健康医疗大数据国家研究院AI算力运维工程师招聘启事

招聘单位

北京大学健康医疗大数据国家研究院

招聘岗位

AI算力运维工程师

招聘范围

校内外公开招聘

岗位职责

1.负责健康医疗大数据平台GPU/CPU科研计算集群的建设、运行和维护;

2.负责基于Slurm等技术的算力资源统一调度、用户管理、任务管理和资源配额管理;

3.负责NVIDIA GPU、CUDA、cuDNN、NCCL及PyTorch等AI计算环境的部署和维护;

4.负责Docker/Apptainer等容器化科研计算环境建设;

5.建设GPU及服务器监控体系,实现GPU利用率、显存、任务和资源使用情况监测;

6.支持单机多卡、多机多卡及分布式AI训练任务,协助定位GPU、通信、存储及网络性能问题;

7.建立GPU-hour等算力使用统计和资源利用分析机制,提高平台整体算力利用效率;

8.为科研人员提供AI计算环境、集群任务及算力使用相关技术支持。

应聘条件

1.计算机、软件工程、电子信息等相关专业本科及以上学历,研究生学历者优先;

2.具有1年以上Linux服务器、GPU集群、HPC或AI计算平台相关经验;

3.熟悉Slurm、PBS、LSF等至少一种集群任务调度系统(具有Slurm实际经验者优先),具备大规模集群任务调度、配额管理、资源优化实战能力;

4.熟悉NVIDIA GPU、CUDA及常见AI计算环境,熟悉NVIDIA GPU硬件架构及NVLink多卡互联机制,熟练掌握CUDA、cuDNN、NCCL底层通信环境部署与调优,熟悉RDMA/InfiniBand高速网络配置、运维及故障排查,精通PyTorch等主流AI框架的集群适配与运行优化;

5.熟悉Docker等容器技术,能够独立完成容器镜像定制、批量部署与环境封装,具备Python/Shell脚本能力;

6.了解Prometheus、Grafana等监控体系,了解DCGM GPU监控工具,可独立搭建、调试、迭代算力集群监控体系;

7.具备较强的问题定位、系统学习和沟通协作能力。

优先考虑:具有NCCL、PyTorch Distributed、RDMA/InfiniBand、NVLink、MIG、Kubernetes、DCGM、JupyterHub或大型GPU集群实际运维经验。

岗位待遇

执行北京大学医学部劳动合同制人员的有关规定

备注说明

此岗位系北京大学医学部合同制(劳务派遣)岗位,无事业编制,不解决北

京户口。

应聘程序

请将个人简历(中英文)及相关证明材料发送至邮箱:Nihds@bjmu.edu.cn

邮件主题请注明“AI算力运维工程师+姓名”。

应聘材料

1.PDF版个人简历(含照片及联系方式);

2.学历证明复印件;

3.能反映相关能力、经验、业绩的材料扫描件。

联系方式

Nihds@bjmu.edu.cn

发布日期

2026年8月20日

截止日期

2026年12月31日

(0)
小助手小助手
上一篇 5小时前
下一篇 5小时前

相关推荐

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注