数据集使用指南
一、这是什么
科学数据广场汇集了来自欧洲生物信息研究所、欧洲中期气象预报中心等 50 家顶尖科研机构的高价值专业数据,覆盖生命科学、地球科学、物质科学、神经科学、空间科学、空气动力学六大学科,目前已集成 200 余个专业数据集,总量达 PB 级。
使用数据集无需繁琐的下载与配置:既可在数据集详情页点击【使用数据集】一键跳转并自动挂载,也可在创建开发机时手动选择数据集挂载,进入开发机后通过本地挂载路径直接读取数据。
二、开始前的准备
- 已登录 Intern Discovery,进入「科学数据」广场。
- 已找到目标数据集(可按学科领域、热门任务筛选,或通过搜索快速定位;也可在【我的收藏】中查看已收藏的数据集)。
- 了解开发机的基本使用方式(详见《启动你的第一台开发机》)。
三、使用数据集
平台提供两种方式将数据集挂载到开发机中使用:
方式一:数据集详情页一键挂载
在数据集详情页点击右上角【使用文件】,会跳转至【创建开发机】页面,并自动挂载该数据集——「数据集挂载」区域已预填该数据集名称及挂载路径。只需选择资源配置、镜像后即可创建开发机,快速进入项目开发。


方式二:创建开发机时手动挂载
也可直接进入「科学计算」,点击【创建开发机】,在「数据集挂载」区域点击【添加】。

在弹出的窗口中,可从「数据集广场」「我的数据集」「我的收藏」三个来源中勾选数据集,最多可同时挂载 5 个。

两种方式最终效果一致:开发机创建后,所选数据集均会挂载至开发机的 /dataset 目录下。
在开发机中读取数据
进入开发机后,挂载的数据集位于 /dataset 目录下,直接通过挂载路径读取即可,无需下载。
示例:挂载了 AFDB 数据集后,Notebook 中的代码示例如下:
# 1. 导入库
import os
import pandas as pd
# 2. 直接用挂载路径读取数据
dataset_path = "/dataset/InternDiscovery/afdb-all"
print("数据集路径下的文件:", os.listdir(dataset_path)[:5])
# 3. 简单查看数据
# df = pd.read_csv(os.path.join(dataset_path, "some_data.csv"))
# display(df.head())
四、数据集 CLI 下载
除页面操作外,也可通过数据集 CLI(discovery-ctl)在终端完成数据集查看与下载,支持 Linux、macOS 及 Windows。使用前需先登录。
登录
discovery-ctl login
查看数据集信息与文件列表
discovery-ctl dataset info --dataset InternDiscovery/stead
查看指定版本的文件列表
discovery-ctl dataset list --dataset InternDiscovery/stead --version main
下载整个数据集
discovery-ctl dataset download --dataset InternDiscovery/stead --output ./local_dir
下载数据集中的指定文件(支持多个文件,用英文逗号分隔)
discovery-ctl dataset download-file --dataset InternDiscovery/stead --remote-path /ReplaceWithRealAddr/ReplaceWithRealFileName --output ./local_dir
五、常见问题
| 问题 | 排查建议 |
|---|---|
| 开发机中找不到数据集 | 挂载的数据集在 /dataset 目录下,确认创建开发机时「数据集挂载」区域已有该数据集(无论是自动预填还是手动添加) |
| 想挂载多个数据集 | 创建开发机页面「数据集挂载」区域点击【添加】,最多可挂载 5 个数据集 |
/data 和 /dataset 分不清 | /dataset 是挂载的数据集,/data 是「我的云盘」(存代码/文件),两者独立 |
| 详情页看不到数据文件内容 | 数据文件需通过数据集 CLI 拉取查看 |
| 想保存感兴趣的数据集 | 在详情页右上角点击【收藏】,可在【我的收藏】中查看 |