训练任务
查看训练任务列表
训练任务是平台统一的模型训练与批量计算入口,用于将代码、镜像、数据集和计算资源组合为可托管运行的任务,位于「科学计算 - 训练任务」标签页下。任务创建后由平台自动调度运行,可在页面查看任务状态、资源配置、运行时长、算力点消耗、训练日志及迭代曲线。
训练任务支持 Git 仓库、本地上传和我的云盘三种代码来源,可选择 CPU、GPU 或 NPU 资源,并挂载训练数据集、验证数据集及自定义超参数。云盘会挂载到训练任务的 /data 目录,如需持久化训练结果或中间产物,请将文件保存到 /data 目录,任务结束或资源释放后仍可保留。

界面说明:页面上方显示总算力点与已用算力点,如需补充算力点可点击【申请增配额】;右上角提供任务名称搜索与【训练任务】新建入口。任务区显示任务总数,支持按状态筛选及按创建时间排序。每张任务卡片展示任务名称、状态、任务 ID、资源配置、运行状态 / 时长、点数单价和已消耗算力点;将鼠标移至任务卡片上,可通过右上角操作入口查看日志、详情、重命名、重新训练或删除任务。运行中的任务还支持停止运行。
申请算力点
点击【申请增配额】,选择所需算力点档位(5000 点、10000 点或 20000 点),填写申请说明后点击【确认】即可提交申请。

新建训练任务
点击右上角【训练任务】进入新建自定义训练任务页面,依次完成任务信息、代码来源、启动命令、资源配置、镜像、数据集、超参数和运行时长配置后,点击【立即创建】即可提交任务。

阅读使用提示
创建任务前,建议先阅读页面顶部的使用提示,确认 TensorBoard 日志和云盘持久化目录的使用方式。
TensorBoard 日志
平台已集成 TensorBoard。如需在任务详情页查看训练曲线,请将 TensorBoard 日志保存到环境变量 TENSORBOARD_LOGDIR 指定的目录。
Python 示例:
import os
from torch.utils.tensorboard import SummaryWriter
log_dir = os.environ.get("TENSORBOARD_LOGDIR")
writer = SummaryWriter(log_dir=log_dir)
云盘持久化
云盘会挂载在 /data 目录下,作为训练任务的持久化存储空间。如需长期保存训练结果或中间产物,请将文件保存至 /data 目录下。任务结束或资源释放后,该目录下的文件仍可保留。
填写任务信息
填写任务名称和任务描述。任务名称为必填项,最多 60 个字符;任务描述为选填项,最多 200 个字符。
选择代码来源
平台支持以下三种代码来源:
- Git 仓库
- 本地上传
- 我的云盘
不同代码来源对应的默认工作目录不同。填写启动命令时,需要根据实际来源使用正确的运行时路径。
Git 仓库
选择【Git 仓库】作为代码来源时,填写 Git 仓库地址和分支名称,默认分支为 main。平台会拉取指定分支的代码,并将代码复制到训练任务的临时工作目录 /code/workspace 下。
因此,填写【启动命令】时,需要基于 /code/workspace 填写要执行的脚本路径。例如,Git 仓库中的训练脚本路径为:
LlamaFactory/platform/run_train.sh
则【启动命令】可填写:
bash /code/workspace/LlamaFactory/platform/run_train.sh
请注意:/code/workspace 是训练任务运行时的临时代码目录,仅用于存放本次任务拉取的 Git 代码。需要长期保存的训练结果、模型文件和中间产物,请写入 /data 目录。
本地上传
选择【本地上传】作为代码来源时,将代码压缩包拖拽到上传区域,或点击【点击上传】选择文件。支持 zip、tar、tar.gz 格式,文件大小不超过 500 MB,禁止在代码包中包含模型权重与大数据集。平台会将上传的代码解压到训练任务的临时工作目录 /code/workspace 下。

填写【启动命令】时,需要基于 /code/workspace 填写要执行的脚本路径。例如,上传的代码中包含以下训练脚本:
LlamaFactory/platform/run_train.sh
则【启动命令】可填写:
bash /code/workspace/LlamaFactory/platform/run_train.sh
请注意:/code/workspace 仅用于存放本次任务上传并解压后的代码。需要长期保存的训练结果、模型文件和中间产物,请写入 /data 目录。
我的云盘
选择【我的云盘】作为代码来源时,需要填写代码所在的文件夹路径。请先在平台云盘中复制目标文件夹的路径,再粘贴到【云盘路径】输入框。云盘会挂载到训练任务的 /data 目录,启动命令中的路径需要以 /data 开头。
这里应填写代码文件夹的路径,而不是具体代码文件的路径。请勿填写 .py、.sh、.ipynb 等文件的地址。

示例一:代码位于指定文件夹
如果训练脚本在云盘中的路径为:
/LlamaFactory/platform/run_train.sh
则【云盘路径】应填写脚本所在的项目文件夹:
/LlamaFactory/platform
【启动命令】填写具体脚本在训练任务中的挂载路径:
bash /data/LlamaFactory/platform/run_train.sh
示例二:代码位于云盘根目录
如果代码文件直接存放在云盘根目录下,则【云盘路径】填写:
/
【启动命令】可填写:
bash /data/run_train.sh
示例三:代码以压缩包形式存放在云盘中
如果代码文件是压缩包,需要在【云盘路径】中填写压缩包所在的文件夹路径,不要填写压缩包文件本身的路径。
例如,代码压缩包在云盘中的位置为:
/project/Offline-task-test-cases.zip
则【云盘路径】应填写:
/project
不要填写:
/project/Offline-task-test-cases.zip
任务启动时,系统会自动将压缩包解压到与压缩包同级的目录下。假设解压后的训练脚本路径为:
/project/Offline-task-test-cases/LlamaFactory/platform/run_train.sh
则【启动命令】可填写:
bash /data/project/Offline-task-test-cases/LlamaFactory/platform/run_train.sh
使用云盘代码时请注意:
· 【云盘路径】只填写代码所在的文件夹路径。
· 如果代码是压缩包,请填写压缩包所在的文件夹路径。
· 系统会自动将压缩包解压到与压缩包同级的目录下。
· 【启动命令】需要按照解压后的代码目录填写。
如果训练前需要安装依赖,可在【启动命令】中先执行依赖安装命令,再启动训练脚本。
填写启动命令
在【启动命令】中填写任务启动后需要执行的命令,最多 500 个字符。命令会在当前代码来源对应的工作目录中执行。
选择资源配置
在资源列表中选择一项资源规格。列表会展示资源名称、GPU / NPU 数量、CPU、内存和显存,支持 CPU、Nvidia GPU、Ascend NPU 等不同类型的资源;不同规格对应的算力点单价不同。
选择镜像
镜像为必填项,可选择【官方镜像】或【我的镜像】,再从下拉列表中选择具体镜像。官方镜像会标明框架及 Python 版本;【我的镜像】中显示用户已构建成功的自定义镜像。
挂载数据集
训练数据集和验证数据集均为选填项。点击对应区域的【添加】,在【数据集挂载】窗口中选择需要使用的数据集。

数据集挂载窗口支持以下操作:
· 可在【数据集广场】【我的数据集】【我的收藏】之间切换数据来源。
· 支持按名称搜索及按分类筛选数据集。
· 勾选一个或多个数据集后,页面底部会显示已选数量;点击【确认】完成挂载,点击【取消】放弃本次选择。
添加超参数
点击【添加参数】新增一组超参数,在 Key 和 Value 输入框中分别填写参数名与参数值;可继续点击【添加参数】添加多组参数,也可删除不需要的参数行。
常见超参数示例如下:
| 参数 | 示例 |
|---|---|
learning_rate | 2e-5 |
batch_size | 32 |
epoch | 3 |
model_name | Llama-3-8B |
以上参数名称和取值仅用于说明填写格式。实际训练时,请根据模型、数据集规模、显存容量及训练代码支持的参数进行调整,并确保 Key 与启动脚本中读取的参数名称一致。

设置运行时长
分别填写任务运行的小时数和分钟数。单次任务最长可设置为 7 × 24 小时。页面底部会根据所选资源与运行时长实时显示预计消耗的算力点、点数单价和当前剩余算力点;确认无误后点击【立即创建】。
搜索、筛选与排序
在页面右上角输入任务名称关键字,可快速搜索对应任务;清空搜索内容即可恢复全部任务。任务列表支持按任务状态筛选,并可点击【创建时间排序】切换创建时间顺序。
停止训练任务
运行中的任务可通过任务卡片右上角操作入口选择【停止】。停止前页面会弹出二次确认;确认后平台将释放任务使用的计算资源,任务状态变为已停止。已写入 /data 目录的文件仍会保留。
查看训练日志
在任务卡片右上角操作入口中点击【日志】,可查看任务名称、运行状态、训练开始时间、资源配置及实时训练日志,用于了解运行进度或排查失败原因。

查看任务详情
在任务卡片右上角操作入口中点击【详情】,可查看任务状态、GPU / NPU、显存、CPU、内存、资源规格、训练代码路径、镜像、创建时间、训练数据集、验证数据集、总运行时长和算力点消耗等信息。
任务详情页下方提供【迭代曲线】区域。训练代码按页面提示写入 TensorBoard 日志后,可在此查看训练过程中的指标曲线。

任务操作
将鼠标移至任务卡片上,通过右上角操作入口可打开任务操作菜单。不同状态下可执行的操作可能不同;已结束任务支持日志、详情、重命名、重新训练和删除等操作。

重命名训练任务
在任务操作菜单中点击【重命名】,输入新的任务名称后点击【确认】即可完成。新名称最多 30 个字符。

重新训练
在任务操作菜单中点击【重新训练】,确认后平台会基于当前任务配置创建一个新的训练任务,原任务及其结果不会被覆盖。

删除训练任务
在任务操作菜单中点击【删除】,页面会弹窗二次确认。确认删除后,该任务的相关记录和结果将永久删除且无法恢复,请谨慎操作。

常见问题
-
任务一直处于排队中怎么办?
任务排队通常与资源调度有关,表示当前所选规格暂时没有可用资源。可等待资源释放;如长时间未开始,可选择其他可用资源规格后重新提交任务。
-
任务失败后如何排查?
在任务操作菜单中点击【日志】,优先查看日志末尾的错误信息,并检查启动命令及脚本路径是否正确、依赖是否安装完整、镜像与代码是否兼容、数据集是否成功挂载,以及所选资源是否满足训练要求。修正问题后,可通过【重新训练】再次发起任务。
-
停止任务后还能继续训练吗?
任务停止后暂不支持从原任务直接继续运行,可通过【重新训练】重新发起任务。如训练程序支持断点续训,请确保检查点已保存到
/data目录,并在新任务的启动命令中指定对应检查点。 -
删除任务后还能恢复吗?
不能。删除后,该任务的相关记录和结果将永久删除且无法恢复。执行删除前,请确认任务记录和相关结果不再需要;需要长期保留的文件,建议提前保存到云盘的
/data目录。