推理服务
推理服务列表
推理服务用于将训练完成的模型部署为可在线调用的 API 服务,位于「科学计算 - 推理服务」标签页下。创建服务时,需要选择模型格式、模型来源、资源配置和运行环境,并填写请求、响应示例及运行时长。服务运行后,可在详情页查看调用地址、调用凭证和调用统计,也可通过在线调试验证服务响应。

界面说明:页面右上角提供服务名称搜索与【新建服务】入口;页面上方显示总算力点、已用算力点和资源使用情况。服务区分为【我创建的】和【分享给我的】两个标签页,支持按状态筛选,并可按创建时间或调用量排序。每张服务卡片展示服务名称、状态、服务 ID、描述、创建时间和调用量,并提供启动、停止、分享和查看等操作。
推理服务常见状态包括:
· 排队中:服务已提交,正在等待资源调度或启动。
· 运行中:服务已启动,可根据权限查看或调用服务。
· 已停止:服务当前不可调用,可重新启动或删除。
新建推理服务
点击右上角【新建服务】进入新建推理服务页面,依次完成基本信息、模型配置、输入输出说明和运行时长配置后,点击【新建推理服务】提交服务。

填写基本信息
填写服务名称和服务描述。服务名称为必填项,最多 60 个字符;服务描述为选填项,最多 200 个字符。建议在名称和描述中体现模型用途或业务场景,便于后续搜索、识别和分享。
选择模型格式
在【模型格式】中选择待部署模型对应的格式。平台当前支持:
· Hugging Face - text-generation
· LightGBM
· PaddlePaddle
· PMML
· Scikit-learn
· TensorFlow SavedModel
模型格式会影响可选的资源配置、运行环境,以及系统自动填入的请求与响应示例。请选择与模型实际导出格式一致的选项;如果格式不匹配,服务可能无法正常启动或处理请求。

选择模型来源
平台支持【我的云盘】和【本地上传】两种模型来源。
我的云盘
选择【我的云盘】后,先在平台云盘中找到模型所在的目标文件夹,复制文件夹地址并粘贴到输入框。
请填写模型文件夹路径,不要填写某个模型文件的具体路径。提交前请确认文件夹中包含所选模型格式运行时需要的完整文件,并保持模型目录结构不变。
本地上传
选择【本地上传】后,将压缩包拖拽到上传区域,或点击上传区域选择文件。支持 zip、tar、tar.gz 格式,单个文件大小不超过 500 MB。
上传内容需要符合页面提示,请勿在压缩包中包含模型权重与大数据集。文件上传后,继续选择与上传内容匹配的模型格式、资源配置和运行环境。
选择资源配置
在资源列表中选择部署推理服务所需的资源规格。列表会展示资源名称、GPU、CPU、内存和显存等信息;实际可选规格以当前账号配额和平台资源为准。
资源配置决定服务运行时使用的计算资源,也会影响可选的运行环境、算力点单价和服务启动速度。请根据模型大小、推理框架和预计请求量选择合适的规格。
选择运行环境
在【运行环境】下拉列表中选择具体镜像。平台会根据模型格式和资源配置筛选兼容的运行环境。例如,Hugging Face 文本生成模型可显示 kserve-huggingfaceserver,LightGBM 模型可显示 kserve-lgbserver;实际选项以页面显示为准。
切换模型格式或资源配置后,运行环境的可选范围可能发生变化。请重新检查并选择与模型兼容的环境。
填写请求与响应示例
在【输入输出说明】中填写【请求示例(JSON)】和【响应示例(JSON)】,每项最多 500 个字符。选择模型格式后,系统会自动填入对应格式的示例,可根据模型的实际输入输出结构进行修改。
请求与响应示例用于说明服务的调用方式,并会显示在服务详情页。示例必须为合法 JSON,字段名称、数据类型和层级结构应与模型实际接收和返回的内容一致。
以文本生成模型为例,请求示例可包含模型名称和消息列表:
{
"model": "internlm-chat",
"messages": [
{
"role": "user",
"content": "请介绍一下上海人工智能实验室。"
}
]
}
以上内容仅用于说明 JSON 填写格式。请以当前模型运行环境支持的字段为准,不要直接将不匹配的示例用于其他模型格式。
设置运行时长并创建服务
分别填写服务运行的小时数和分钟数,单次最长可设置为 7 × 24 小时。页面底部会根据所选资源和运行时长实时显示预计消耗的算力点、点数单价及当前剩余算力点。
确认模型格式、模型来源、资源配置、运行环境、输入输出示例和运行时长无误后,点击【新建推理服务】。平台会提交服务并进行资源调度,服务卡片会显示当前状态。
搜索、筛选与排序
在页面右上角输入服务名称关键字,可快速搜索对应服务;清空搜索内容即可恢复全部服务。
在服务列表上方选择状态,可查看对应状态的服务;点击【创建时间排序】或【调用量排序】,可切换相应字段的排序顺序。
查看服务详情
在服务卡片中点击【查看】,打开服务详情。详情页主要包含以下信息:
· 基本信息:服务状态、服务名称、服务 ID、创建者、创建时间和服务描述。
· 调用信息:请求地址、请求方法、Content-Type、调用凭证、请求示例和响应示例。
· 调用统计:今日调用量、累计调用量、调用成功率和平均响应时长。

调用凭证属于敏感信息,请仅提供给需要调用该服务的人员,不要将凭证明文写入公开代码仓库、文档或日志。
调用推理服务
服务处于【运行中】状态后,可在服务详情页复制请求地址、调用路径和调用凭证,并根据页面中的请求示例发起 POST 请求。请求的 Content-Type 为 application/json。
以下示例使用占位符演示调用结构:
curl -X POST 'https://discovery-dev.intern-ai.org.cn/api/ml/v1/inference/user/call_api' \
-H 'Content-Type: application/json' \
-d '{
"call_api_path": "/inference/<service_id>/",
"call_api_credential": "<call_api_credential>",
"payload": "{\"inputs\":\"Replace with your model input\"}"
}'
调用时请替换以下内容:
· <service_id>:服务详情页显示的服务 ID。
· <call_api_credential>:服务详情页显示的调用凭证。
· payload:传递给模型的实际请求内容。该字段为 JSON 字符串,需要对内部双引号进行转义,并与创建服务时填写的请求示例保持一致。
不同模型格式的请求结构可能不同。请优先复制服务详情页提供的调用信息和请求示例,不要直接复用其他服务的服务 ID、调用凭证或 payload。
在线调试
具备调用权限时,可在服务详情页的在线调试区域输入请求内容,并点击【发送测试调用】验证服务响应。
建议先复制详情页中的请求示例,再根据实际模型输入进行修改。提交前请确认内容为合法 JSON,并与模型格式和运行环境要求一致。测试调用也会使用该推理服务的运行资源。
如果仅具备只读权限,可查看服务基本信息,但不能调用服务或使用在线调试。
查看服务日志
在【我创建的】服务卡片上打开操作菜单,点击【日志】,可查看服务名称、服务状态和服务日志。点击【复制】可复制当前日志内容。

服务启动失败或调用异常时,建议优先查看日志末尾的错误信息,并检查模型目录是否完整、模型格式是否匹配、运行环境是否兼容,以及请求字段和数据类型是否正确。
服务操作
在【我创建的】服务卡片上打开操作菜单,可根据服务状态执行【日志】【重命名】【续时长】或【删除】等操作。运行中的服务可停止,已停止的服务可重新启动。

启动推理服务
已停止的服务可在服务卡片中点击【启动】。在弹窗中设置本次运行时长,确认预计消耗和剩余算力点后点击【确认】。
单次运行时长最长可设置为 7 × 24 小时。提交后,服务会进入资源调度流程;状态变为【运行中】后方可调用。

停止推理服务
运行中的服务可在服务卡片中点击【停止】。页面会弹出二次确认;确认后平台将停止服务并释放其使用的计算资源,服务状态变为【已停止】。
服务停止后无法继续接收推理请求。如需再次使用,请重新启动服务并等待状态变为【运行中】。
续时长
运行中的服务可在操作菜单中点击【续时长】。分别填写需要增加的小时数和分钟数,确认续时后的运行时长、预计消耗、点数单价和剩余算力点后点击【确认】。
单次续时最长可设置为 7 × 24 小时。为避免服务到期停止,建议在当前运行时长结束前完成续时。
重命名服务
在服务操作菜单中点击【重命名】,输入新的服务名称后点击【确认】。服务名称最多 60 个字符。
重命名只会修改列表和详情页中显示的名称,不会修改服务 ID。调用服务时仍应使用详情页当前显示的服务 ID、调用路径和调用凭证。
分享服务
在【我创建的】服务卡片中点击【分享】,打开【分享管理】。可通过 SSO 昵称、ID、手机号或邮箱搜索用户,选择权限后确认分享。

平台支持以下分享权限:
· 只读:可查看服务基本信息,但不能调用服务。
· 可调用:可查看服务信息并调用服务接口,也可使用在线调试。
分享管理窗口会显示已分享用户、权限、分享时间和状态,并支持调整或移除分享。被分享用户调用服务时,会使用服务所有者的运行资源,请谨慎授予调用权限。
调用凭证属于敏感信息。即使已经授予调用权限,也不建议通过聊天、邮件或公开文档额外传递明文凭证。
查看“分享给我的”服务
切换到【分享给我的】标签页,可查看其他用户分享的推理服务。服务卡片会显示分享者、我的权限、分享时间和服务创建时间等信息。

点击【查看】可打开服务详情。具备【可调用】权限时,可按详情页提供的调用信息调用服务;仅具备【只读】权限时,只能查看相应信息。
移除分享
在【分享给我的】服务卡片中点击【移除分享】,并在确认弹窗中点击【确认】。移除后,该服务将从【分享给我的】列表中消失,且无法再通过原分享关系查看或调用。
移除分享不会删除服务所有者创建的服务。如需再次访问,需要由服务所有者重新分享。
删除推理服务
删除操作仅适用于已停止的服务。在服务操作菜单中点击【删除】,页面会弹出二次确认;确认后,服务记录将被永久删除,且无法恢复。

删除前请确认服务已不再使用,并妥善保存仍需保留的模型文件、请求与响应示例、调用统计或日志信息。删除服务不会删除云盘中的源模型文件。
常见问题
-
服务一直处于排队中怎么办?
服务排队通常与资源调度有关。可等待资源释放,并检查当前资源配额和算力点是否充足。如果长时间未进入运行状态,可停止服务后调整资源规格或运行时长,再重新启动或创建服务。
-
为什么没有可选的资源配置或运行环境?
可选项会根据模型格式、账号配额和当前平台资源进行筛选。请确认模型格式已选择、账号有可用资源配额,并尝试重新选择模型格式或资源规格。切换资源后,请重新选择运行环境。
-
服务启动失败后如何排查?
打开【日志】,优先查看末尾的错误信息。重点检查模型目录和文件是否完整、模型格式是否正确、模型是否与运行环境兼容,以及上传文件是否符合页面要求。
-
调用服务返回错误怎么办?
请确认服务状态为【运行中】,请求地址、服务 ID 和调用凭证来自同一个服务,并检查
payload是否为正确转义的 JSON 字符串。请求内容还需要与详情页中的请求示例及模型实际输入结构保持一致。 -
为什么在线调试按钮不可用或不可见?
请先确认服务处于【运行中】状态,并检查当前权限。服务所有者或具备【可调用】权限的用户可以调用服务;仅具备【只读】权限时,不能使用在线调试。
-
服务到达运行时长后会怎样?
服务到期后会停止运行,停止期间无法接收推理请求。如需继续使用,可在到期前执行【续时长】,或在停止后重新启动服务。
-
分享服务后,调用会消耗谁的资源?
被分享用户的调用会使用服务所有者的运行资源。建议仅向确有需要的用户授予【可调用】权限,并定期在分享管理中检查已分享用户和权限。
-
停止服务后还能重新启动吗?
可以。在已停止服务的卡片中点击【启动】,设置新的运行时长并确认。服务重新进入【运行中】状态后即可调用。
-
删除服务后还能恢复吗?
不能。删除操作永久生效。删除前请确认服务记录、调用信息、日志及统计数据不再需要;云盘中的源模型文件不会随服务一起删除。