训练任务
“业务管理 > 任务管理”,在业务范围是训推、训练下可用
创建训练任务
本手册以tensorflow单机任务为例子进行说明。 功能说明:用户通过平台提供的训练任务功能,能够自动创建一个新的训练任务,创建成功后自动在任务管理列表展示该任务。 操作步骤:
- 进入“业务管理 > 任务管理”,单击页面“创建”按钮,弹出填写任务信息页面,如下图:

- 填写任务详细信息: 名称:任务名字(只接受英文字母、数字和下划线,不能以下划线开头)。 镜像:在第一个窗口选择tensorflow框架名称,在第二个窗口选择框架版本。 外部镜像:勾选该选项后,用户可以自定义输入镜像名称。 部署类型:训练任务部署类型,选择“单机”。 资源组:选择资源组。 网络类型:选择相应网络类型。 加速卡系列:根据下拉列表配置可选择相应的加速卡系列;只能使用一种类型提交任务;右侧的可用节点信息会根据所选加速卡系列,进行动态筛选变化。 加速卡类型:选择资源组内相应的加速卡类型。 CPU/加速卡:选择Worker节点的CPU/加速卡资源配置方案,当配额方案是“自定义”时,会弹出加速卡和CPU窗口,可以自定义设置资源配置方案。 脚本:单击窗口后的按钮,弹出“选择启动文件”窗口,选择tensorflow单机训练脚本。 脚本示例路径:/xlz/models/tensorflow/mnist/tf_mnist_single.py 说明:xlz这个表示用户的家目录,最终以实际的用户名为准;选定后单击确定。 “选择启动文件”中有两个子选项,分别为 “历史访问”、“个人数据”。“历史访问”表示以前使用过的启动脚本,展示在此处以便用户选择。“个人数据”表示自己文件中的数据文件。


命令:用户单击“命令模式”会切换到命令模式,可以自定义自己的启动命令。 执行目录:选择执行训练脚本的目录,执行目录可以选择自己目录下的任何文件夹。 脚本参数:在“脚本参数”输入框可以输入python脚本所跟随的参数,例如“--data_dir /MNIST_data --data_dir2 /MNIST_data2” 弹性任务配置:

目前训练框架支持Horovod+Tensorflow, Horovod+Pytorch, Pytorch DDP方式的弹性任务。 用户单击“弹性任务”开启,设置“最大Worker个数”大于“最小Worker个数”,完成弹性任务配置。
- MPI弹性任务,增加命令参数:--host-discovery-script /etc/mpi/discover_hosts.sh,命令参数示例
horovodrun --verbose -np 2 --min-np 2 --max-np 4 --blacklist-cooldown-range 120 300 --host-discovery-script /etc/mpi/discover_hosts.sh python train.py
- Pytorch弹性任务,命令参数示例
torchrun --nnodes=2:4 --nproc_per_node=1 --max_restarts=100 --rdzv_id=1 --rdzv_backend=c10d --rdzv_endpoint=$MASTER_ADDR":"$MASTER_PORT python train.py

大模型分布式任务: 在镜像框架选择为Pytorch时,平台提供DeepSpeed、Megatron两个大模型框架。 在DeepSpeed框架下,平台自动生成hostfile文件,训练脚本可指定参数--hostfile=/opt/kube/hostfile启动训练。 在Megatron框架下,平台会启动一个master和页面参数指定个数的worker,在容器内自动设置MASTER_ADDR、MASTER_PORT、RANK等环境变量。训练程序可以直接使用环境变量启动训练。

数据配置: 单击“数据配置 > 数据”,提供2种数据配置方式:

数据-文件管理 在弹出的路径选择窗口中选择要使用的数据集,支持选择多个数据集。 数据-数据集管理 在数据集列表中选择可用数据集,只能选择一个数据集。 更新数据集说明:勾选后,平台自动会对缓存的数据集进行识别,如果部分数据集文件发生变化,平台会实现增量更新,如果缓存中没有数据集,会全量下载数据集。如果缓存中的数据集正在使用,则不能进行更新操作。 数据集使用方式说明:有“节点缓存”和“直接使用”两种方式。“节点缓存”表示将数据集缓存到节点,“直接使用”表示使用共享存储中的数据集。 注意:数据集也可以来自于用户目录、公共目录(全局共享和组共享),数据集可以选择多个。数据集示例路径:/MNIST_data 解压数据集说明:只有节点缓存方式支持解压操作,解压支持递归解压,解压类型支持:tar、tar.gz、zip、gz、tar.bz2,解压目录和压缩包目录同级且同名,解压支持单个数据集操作。 选择模型:用户可选择需要挂载的模型。 环境变量:用户可添加自定义环境变量。 更多配置:
| 功能 | 描述 |
|---|---|
| 调度策略 | 配置调度策略,目前支持spread(默认)、bestfit。 |
| 端口 | 提供服务端口访问能力,容器内服务端口会自动映射到宿主机的端口上,且支持多个端口设置,多端口之间用英文状态下的分号隔开,第一个端口具有容错能力,其他端口只提供服务功能。设置完成后,可以在实例列表中查看到对应的端口信息。 |
| 内存 | 配置训练任务Worker节点所需要的内存,当设置为0时表示无限制(需要小于Worker所在主机目前剩余内存量)。 |
| 日志路径 | 训练日志输出路径,单击窗口后的按钮,选择相应路径后单击“确定”。 |
| 目录挂载 | 可供挂载的公共目录。 |
| shm_size | 容器shm_size参数,默认为4GB。 |
在右侧区域显示资源组下的节点信息,这里可以自定义运行的节点,比如需要在ainode53上运行该任务,可以直接勾选,这样平台会默认调度到该节点上。节点列表中还可以看到每个节点上资源的情况。如果不选择节点,则平台会自动选择剩余资源满足的节点运行该任务。 3. 信息填写完之后,单击“确定”按钮创建任务,任务展示在任务管理列表中。
停止训练任务
功能说明:用户通过平台提供的停止训练任务功能,能够停止一个正在运行的训练任务。工作流相关类型的任务不支持该操作。 操作步骤:
- 进入“业务管理 > 任务管理”,选中一个正在运行的训练任务,单击“停止”按钮。
- 页面显示停止成功表示该操作成功。
启动训练任务
功能说明:用户通过平台提供的启动训练任务功能,能够启动一个停止的训练任务。工作流相关类型的任务不支持该操作。 操作步骤:
- 进入“业务管理 > 任务管理”,选中一个停止的训练任务,单击“启动”按钮。
- 任务重新启动说明操作成功。
重新提交训练任务
功能说明:用户通过平台提供的重新提交训练任务功能,能够重新提交一个训练任务。工作流相关类型的任务不支持该操作。 操作步骤:
- 进入“业务管理 > 任务管理”,选中一个训练任务,单击“重新提交”按钮。
通过历史记录提交训练任务
功能说明:用户通过平台提供的通过历史记录提交训练任务功能。 操作步骤:
- 进入“业务管理 > 任务管理”,单击“创建”按钮,进入任务信息填写窗口,如下图:

- 可以将历史任务进行归档与取消归档,归档之后展示优先级提前。
- 选中相应的历史任务后,单击后将自动填充历史任务信息:框架类型、镜像、加速卡、CPU、内存、启动文件、数据集等信息。
删除训练任务
功能说明:用户通过平台提供的删除训练任务功能,能够删除一个训练任务。工作流相关类型的任务不支持该操作。 操作步骤:
- 进入“业务管理 > 任务管理”,选中一个训练任务,单击“删除”按钮。
- 页面显示删除成功表示该操作成功。
筛选未终结任务
功能说明:用户通过筛选功能筛选未终结的任务。 操作步骤:
- 进入“业务管理 > 任务管理”,单击“任务管理”列表,通过筛选功能进行筛选。
筛选终结任务
功能说明:用户通过筛选功能筛选终结的任务。 操作步骤:
- 进入“业务管理 > 任务管理”,单击“终结任务”列表,通过筛选功能进行筛选。
查看训练日志
功能说明:用户通过平台提供的查看任务日志功能,能够查看具体的训练日志。 操作步骤:
- 进入“业务管理 > 任务管理”,单击任务名字跳转到任务详情页面,单击“任务日志”按钮可以查看训练日志。
查看容器实例
功能说明:用户通过平台提供的查看任务容器实例功能,能够查看任务的容器实例信息和监控信息。 操作步骤:
- 进入“业务管理 > 任务管理”,单击任务名字跳转到任务详情页面,单击“容器实例”按钮可以查看容器实例信息,如下图:

容器实例列表包括:名称、状态、加速卡、节点、IP、端口、操作列。 性能曲线可以通过单击容器实例列表选择展示对应容器实例的数据,可以通过单击“15分钟”、“4小时”、“24小时”、自定义时间限制查询时间范围,如果容器所在节点使用了IB或RoCE网络可以通过“Infiniband”弹框筛选性能曲线中展示的对应网卡。 性能曲线指标包括:
| 场景 | 性能曲线指标 |
|---|---|
| 基本场景 | CPU利用率、内存利用率、网络输入/输出、内存总量/已用、磁盘输入/输出 |
| 使用GPU场景 | 基本场景下新增:加速卡利用率、加速卡显存利用率、加速卡显存已用、加速卡显存未用、draw_active、fp64_active、fp32_active、fp16_active、gr_engine_active、sm_active、sm_occupancy、tensor_active、pcie_rx_bytes、pcie_tx_bytes、nvlink_rx_bytes、nvlink_tx_bytes |
| 使用MIG场景 | 基本场景下新增:MIG显存利用率、MIG显存已用、MIG显存未用、draw_active、fp64_active、fp32_active、fp16_active、gr_engine_active、sm_active、sm_occupancy、tensor_active |
| 使用IB或RoCE网络场景 | 基本场景下新增:ib_xmitdata、ib_rcvdata、ib_xmitpktsize、ib_rcvpktsize |
仅支持NVIDIA DCGM Profiling Metrics的GPU型号才会展示如下性能指标:gr_engine_active、sm_active、sm_occupancy、tensor_active、dram_active、fp16_active、fp32_active、fp64_active、pcie_rx_bytes、pcie_tx_bytes、nvlink_rx_bytes、nvlink_tx_bytes
查看任务基本信息
功能说明:用户通过平台提供的查看任务基本功能,能够查看任务的基本信息。 操作步骤:
- 进入“业务管理 > 任务管理”,单击任务名字跳转到任务详情页面,单击“基本信息”按钮可以查看任务基本信息。
任务可视化
功能说明:用户通过平台提供的可视化功能,能够查看任务的训练日志。 操作步骤:
- 进入“业务管理 > 任务管理”,在任务列表的操作栏,单击“可视化”按钮。
- 如果在创建任务的时候没有选择日志路径,在此处将会再次提示用户选择。
- 单击“确定”后,弹出可视化窗口。
提交紧急任务
如果用户有提交紧急任务的权限,当单击“创建”按钮,创建任务时,可以看到紧急任务的开关。

开启紧急任务开关,单击“确定”按钮,提交一个紧急任务。