Skip to main content

数据集使用指南

一、这是什么

科学数据广场汇集了来自欧洲生物信息研究所、欧洲中期气象预报中心等 50 家顶尖科研机构的高价值专业数据,覆盖生命科学、地球科学、物质科学、神经科学、空间科学、空气动力学六大学科,目前已集成 200 余个专业数据集,总量达 PB 级。

使用数据集无需繁琐的下载与配置:既可在数据集详情页点击【使用数据集】一键跳转并自动挂载,也可在创建开发机时手动选择数据集挂载,进入开发机后通过本地挂载路径直接读取数据。

二、开始前的准备

  1. 已登录 Intern Discovery,进入「科学数据」广场。
  2. 已找到目标数据集(可按学科领域、热门任务筛选,或通过搜索快速定位;也可在【我的收藏】中查看已收藏的数据集)。
  3. 了解开发机的基本使用方式(详见《启动你的第一台开发机》)。

三、使用数据集

平台提供两种方式将数据集挂载到开发机中使用:

方式一:数据集详情页一键挂载

在数据集详情页点击右上角【使用文件】,会跳转至【创建开发机】页面,并自动挂载该数据集——「数据集挂载」区域已预填该数据集名称及挂载路径。只需选择资源配置、镜像后即可创建开发机,快速进入项目开发。

数据集详情页点击使用数据集跳转创建开发机并自动挂载
数据集详情页点击使用数据集跳转创建开发机并自动挂载

方式二:创建开发机时手动挂载

也可直接进入「科学计算」,点击【创建开发机】,在「数据集挂载」区域点击【添加】。

创建开发机页面的数据集挂载区域

在弹出的窗口中,可从「数据集广场」「我的数据集」「我的收藏」三个来源中勾选数据集,最多可同时挂载 5 个。

选择数据集挂载弹窗

两种方式最终效果一致:开发机创建后,所选数据集均会挂载至开发机的 /dataset 目录下。

在开发机中读取数据

进入开发机后,挂载的数据集位于 /dataset 目录下,直接通过挂载路径读取即可,无需下载。

示例:挂载了 AFDB 数据集后,Notebook 中的代码示例如下:

# 1. 导入库
import os
import pandas as pd

# 2. 直接用挂载路径读取数据
dataset_path = "/dataset/InternDiscovery/afdb-all"
print("数据集路径下的文件:", os.listdir(dataset_path)[:5])

# 3. 简单查看数据
# df = pd.read_csv(os.path.join(dataset_path, "some_data.csv"))
# display(df.head())

四、数据集 CLI 下载

除页面操作外,也可通过数据集 CLI(discovery-ctl)在终端完成数据集查看与下载,支持 Linux、macOS 及 Windows。使用前需先登录。

登录

discovery-ctl login

查看数据集信息与文件列表

discovery-ctl dataset info --dataset InternDiscovery/stead

查看指定版本的文件列表

discovery-ctl dataset list --dataset InternDiscovery/stead --version main

下载整个数据集

discovery-ctl dataset download --dataset InternDiscovery/stead --output ./local_dir

下载数据集中的指定文件(支持多个文件,用英文逗号分隔)

discovery-ctl dataset download-file --dataset InternDiscovery/stead --remote-path /ReplaceWithRealAddr/ReplaceWithRealFileName --output ./local_dir

五、常见问题

问题排查建议
开发机中找不到数据集挂载的数据集在 /dataset 目录下,确认创建开发机时「数据集挂载」区域已有该数据集(无论是自动预填还是手动添加)
想挂载多个数据集创建开发机页面「数据集挂载」区域点击【添加】,最多可挂载 5 个数据集
/data/dataset 分不清/dataset 是挂载的数据集,/data 是「我的云盘」(存代码/文件),两者独立
详情页看不到数据文件内容数据文件需通过数据集 CLI 拉取查看
想保存感兴趣的数据集在详情页右上角点击【收藏】,可在【我的收藏】中查看