一、背景

360 智汇云面向开发者,提供了覆盖大模型开发、评测、数据标注、AI 应用全流程开发,以及智能体构建与运行的完整底层 AI 基础设施服务。


在大模型能力层面,智汇云打造了 “天纪平台” 矩阵:
  • 大模型开发 TLM:支持大模型的微调、训练,提供模型从 0 到 1 的构建能力;
  • AI 评测平台 TEP:实现对大模型与智能体的全面评估;
  • AI 标注平台 TLP:集成大模型标注与机器学习标注能力,为模型训练提供高质量数据支撑;
  • AI 开发平台 TAI:提供全流程 AI 应用开发能力,降低 AI 落地门槛。

过去,天纪平台主要通过Web页面提供给用户使用。这样的方式直观、易理解,适合人工交互。但当平台能力逐步丰富,使用者角色不断增多,调用频次越来越高,页面就不再是最合适的唯一入口。

为什么是CLI呢?一方面,页面适合交互式操作,但不利于沉淀为标准流程。很多高频动作虽然可以在页面中完成,但它们往往依赖用户对平台路径、参数位置和操作顺序的熟悉程度。这种方式适合人工处理,却不利于自动化复用。另一方面,直接开放底层接口虽然灵活,但对使用者要求较高。调用者不仅要理解接口语义,还要处理参数组织、对象关系和认证配置,使用门槛相对较高。对于很多以任务目标为导向的使用者来说,他们更关心的是“我要创建什么”“我要查询什么”“我要管理什么”,而不是底层接口的组织方式。CLI正好处在页面和原始接口之间。它既比页面更结构化,又比底层接口更易用;既适合人工执行,也适合脚本和Agent调用。对于正在拥抱Agent的平台来说,这是一层非常关键的承接能力。更进一步看,CLI还有一个常被低估的价值:它天然具有“标准动作”的形态。一个页面路径可能会随着交互设计不断变化,但一个命令一旦被定义清楚,就更适合作为长期稳定的操作约定。这也是平台能力能够逐步走向自动化和智能化的基础。

再往前一步,当Agent开始参与任务拆解、步骤编排和动作执行时,平台更需要一种比页面更稳定、更结构化的交互方式。Agent需要的不是一个只能“看”的平台,而是一个可以“执行”的平台。它需要稳定、结构化、可调用、可编排的操作接口,来承接从意图理解到动作落地的完整链路。换句话说,平台如果希望真正进入Agent时代,就不仅要有能力展示层,还要有能力执行层。

在这样的背景下,平台选择将核心操作能力进一步沉淀为统一CLI。它不是简单增加一个命令行工具,而是在平台层构建一个同时面向人和Agent的标准执行接口。这个变化背后,意味着平台能力开始从“面向页面组织”逐步走向“面向执行组织”,从而让平台更容易被理解、被调用、被复用,也更容易被接入更广泛的自动化体系。

二、Prophet CLI想解决什么问题

Prophet CLI的目标,不是把页面能力简单搬到命令行,而是把平台操作沉淀为一组清晰、统一、可复用的标准动作。如果从平台演进角度看,这种沉淀有点像为平台补上一层“通用操作语言”。当各种平台能力都能被表达成一致的命令形态时,用户理解成本会下降,团队协作会更顺畅,Agent也更容易真正成为平台的一部分。

它重点解决以下几个问题:
第一,统一入口。 
平台往往会逐步扩展出多条产品线和多类能力,如果每类能力各自发展,用户和调用方都会面临入口分散、认知割裂的问题。统一 CLI能把这些能力收敛到同一个操作体系中,让平台从“多个工具集合”走向“一个有组织的能力系统”。
第二,降低复杂度。 
很多平台动作背后都涉及参数组合、资源选择、对象匹配等细节。CLI可以把这些复杂度收敛到更贴近业务语义的命令中,让使用者以更自然的方式表达目标。对于使用者而言,重要的是完成任务,而不是学习平台内部所有细节。
第三,增强复用性。 
当一个动作被沉淀为标准命令后,它就不再只是“某个人会做的一套页面操作”,而是一个可以被不同人、不同脚本、不同Agent反复调用的标准能力。这种复用,不只体现在调用层面,也体现在认知层面和协作层面。
第四,为Agent提供执行平面。 
Agent的价值不只是辅助理解,更重要的是能否稳定执行。CLI提供了天然结构化的执行接口,让Agent更容易把用户意图转成具体动作,也让平台具备把“建议”落地为“执行”的可能性。

三、设计思路

3.1 Prophet CLI

Prophet CLI的核心思路可以概括为一句话:统一入口、按域组织、按动作执行。
在使用体验上,平台为不同产品能力提供统一命令入口,让用户在同一套命令体系中完成不同场景下的操作。无论是资源类能力、训练类能力,还是后续扩展的新能力,都可以纳入一致的使用方式中。
这种一致性并不只是“形式统一”这么简单。它意味着平台在对外表达能力时,开始采用统一的心智模型:用户只需要理解“我正在操作哪个对象,我要对它做什么”,而不需要在不同系统之间频繁切换思维方式。

```textprophet/    ├── __init__.py    ├── prophet_cli.py    ├── setup.py    └── products/        ├── __init__.py        ├── tai/        │   ├── __init__.py        │   ├── cli.py        │   └── core/        ├── tlm/        │   ├── __init__.py        │   ├── cli.py        │   └── core/        └── tlg/            ├── __init__.py            ├── cli.py            └── core/```

从架构设计看,这套 CLI不是一个单点工具,而是一个可扩展的操作层。它在上层提供统一入口,在中间按产品和能力域组织命令,在下层对接平台已有服务能力。这样做的好处是,平台既能保持整体一致性,又能为不同能力保留独立演进空间。

对平台而言,这种设计还有一个很重要的现实意义:当能力逐步增多时,平台不必反复重新设计用户入口,而是可以在统一框架内持续生长。对于外部合作伙伴、生态接入方和自动化系统来说,这种稳定性同样是非常重要的。

如果把它抽象成一个简单架构,可以理解为三层:
1. 统一入口层 
提供统一命令入口,承接用户和Agent的操作请求。
2. 能力组织层 
 按产品、场景和动作组织命令,把平台能力表达成易理解、易调用的结构。
3. 平台服务层 
由已有平台服务承接具体执行,CLI负责把操作意图转换成标准调用。
这种分层方式的价值在于,它既能保证使用体验统一,也能保证平台能力持续演进时不会互相牵制。平台可以在不改变整体对外形态的前提下,持续扩展新的能力域和新的操作对象。

3.2 Agent SKILL

我们提供了对应的SKILL,可以轻易的接入主流Agent工具,包括但不限于ClaudeCode、CodeX、OpenClaw、Copilot Code等等。

将平台的能力开放给Agent时,最担心的往往是“不可控”与“瞎编造”。为此,我们在底层注入了这套SKILL规范。这套规范教会Agent如何“克制”与“严谨”:它不会盲目自信地拼接长命令,而是会谦虚地先查阅 --help 文档;它懂得在创建任务前先去检索所需的资源;它知道用结构化的JSON来保障数据处理的精确度;它更懂得在面对高危操作时,停下来询问人类的意见,这不仅是一份命令指南,更是Agent在平台上安全作业的护栏。这套SKILL可以成功将一个聪明的 AI,塑造成一位严谨、安全、遵循标准SOP的平台工程师。

---name: prophet-clidescription: Prophet 平台的 TAI、TLM 相关 API 命令行接口。用于管理 notebook、存储卷、分布式训练、模型微调、强化训练和推理服务。version: 1.0.0triggers:  - "tai平台"  - "tlm平台"  - "prophet平台"  - "tai"  - "tlm"  - "prophet"---# Prophet CLI操作技能这是一个用于操作 Prophet 平台(包含 TAI 和 TLM)的技能。通过 `prophet` 命令行工具,可以管理底层计算资源和大模型相关的训练/推理任务。## 核心工作原则:渐进式命令探索**不要在没有确认参数的情况下猜测长命令的参数!** CLI的参数可能随着版本发生改变。请严格遵循以下**渐进式**步骤来完成用户的任务:1. **确定平台与模块**:根据用户需求,确定是使用 `tai` 还是 `tlm`,以及具体的子模块(如 `notebook`, `job`, `train`)。2. **获取命令帮助(必须)**:在执行创建、更新等复杂操作之前,**必须**先执行带有 `--help` 的命令来获取当前的准确参数列表。例如:   ```bash   prophet_cli tai notebook create --help   prophet_cli tlm train create --help   ```3. **收集前置信息**:很多命令需要明确的 `project-id`、`series`(资源规格)或 `dataset-name`。在创建之前,可以使用对应的 `list` 或 `list-series` 命令查询这些前置 ID/Name。4. **执行并解析**:执行命令时,为了方便 AI 解析结果,建议加上 `--json` 参数。5. **高危命令确认**:执行停止、删除、重启等高危命令时,必须让用户同意!!!不可自主决定!!!---##  平台能力总览### 1. TAI 平台 (`prophet_cli tai`)主要用于基础计算资源分配、交互式开发和常规分布式任务。所有操作一般需要提供 `--project-id`(或通过环境变量 `PROPHET_PROJECT_ID` 传入)。* **Notebook (`prophet_cli tai notebook`)**:交互式建模环境。  * `create`: 创建 notebook。资源规格支持传名称(如 `--series "CPU基础版" --series-count 4`)或直接传 ID。支持挂载多种类型存储卷。  * `list`: 列出 notebook。支持按状态、关键字分页查询。  * `get`: 获取详情。  * `update`: 更新配置(延长运行时长或更新描述等)。  * `stop`, `restart`: 停止(加上 `--purge` 可彻底删除)、重启。* **存储卷 (`prophet_cli tai volume`)**:管理 cephfs, polefs等存储卷。  * `list`: 列表查询,支持按挂载类型(type)、读写权限、集群或持有者(holder)过滤。  * `get`: 查询特定存储卷详情。  * `count`: 查询资源组/项目的存储卷数量。* **训练任务 (`prophet_cli tai job`)**:提交常规的 PyTorchJob 或 RayJob 分布式训练任务。  * `create`: 创建任务。需指定 `job-type` (`pytorchjob` 或 `rayjob`),同样支持传入资源规格名称及节点数。  * `list`: 列表查询,可按任务类型、运行状态(pending/running/succeeded/failed/interrupted)过滤。  * `get`: 获取详情。  * `update`: 更新配置描述。  * `stop`: 停止运行中的任务。### 2. TLM 平台 (`prophet_cli tlm`)主要用于大语言模型(LLM)的微调(SFT)、强化学习(RFT)、蒸馏(Distill)和数据集管理。* **大模型训练 (`prophet_cli tlm train`)**:  * `create`: 创建大模型训练任务。**参数极其丰富,务必先看 `--help`**。    * 支持通过 `--model-base-name`(如 Qwen3)和 `--model-scale`(如 14B)自动补齐模型 ID、版本、来源等信息。    * 支持的 `--training-method` 包含:LORA, SFT, DPO, KTO, QLORA, FULL, RFT_PPO, RFT_GRPO 等。    * 数据集支持通过 `--dataset-name` 和 `--dataset-tag` 指定,CLI会自动在 square / my 数据集中查找匹配项。    * `--resource-config` 支持传入集群、资源规格名称和卡数,内部会自动尝试转换成 TAI 所需的规格 ID。    * `--train-config` 允许传入 JSON 配置学习率、epochs、rank、sequence_length 等超参数。  * `list`: 任务列表查询。  * `get`: 任务详情查询。  * `stop`: 停止训练。  * `save`: 将训练结果保存为模型资产。  * `delete`: 删除任务。  * `get-resource`: 根据模型规模、资源系列和训练方法查询推荐资源配置。  * `overview`, `list-lora`: 查询训练大盘和 LoRA 模型列表。* **模型蒸馏 (`prophet_cli tlm distill`)**:  * `create`: 创建蒸馏任务。需要同时指定学生模型和教师模型:    * `--student-model-name` / `--student-model-scale`    * `--teacher-model-name` / `--teacher-model-scale`  * 数据集支持:    * `--dataset-name` + `--dataset-tag`:指定训练数据集;    * `--eval-dataset-name` + `--eval-dataset-tag`:可选指定评测数据集;  * `--resource-config`: 支持自定义蒸馏资源配置,也支持用资源规格名称 + 数量自动换算为 TAI 规格 ID。  * `--train-config`: 支持传入蒸馏超参数 JSON。  * `list`: 查看蒸馏任务列表。  * `get`: 查看蒸馏任务详情。  * `stop`: 停止蒸馏任务。  * `save`: 保存蒸馏产出的模型。  * `delete`: 删除蒸馏任务。* **数据集 (`prophet_cli tlm dataset`)**:模型微调和蒸馏所用数据集管理。  * `list`: 列表查询,支持查询公开库(square)或个人私有的数据集。  * `get`: 详情查询。---## 环境变量与配置执行命令前需要环境具备以下变量(如果用户没有提供,你可以提示用户设置):- `PROPHET_AK`: Access Key- `PROPHET_SK`: Secret Key- `PROPHET_PROJECT_ID`: 默认项目 ID---##  实战示例**场景:用户让你在 TAI 平台上创建一个挂载了 test-data 存储卷的 notebook**1. 你首先确认需要用到的命令是 `prophet_cli tai notebook create`2. 运行 `prophet_cli tai notebook create --help` 获取精确的参数选项。3. 发现需要 `project-id`, `cluster`, `series` 等必填项,若用户未提供,你可以使用 `prophet_cli tai notebook list-series` 查看有哪些资源,并向用户确认。4. 结合 `--help` 里的说明,构建并执行完整的命令:   `prophet_cli tai notebook create --name test-nb --cluster bjzdt --series "CPU基础版" --series-count 4 --volume-name test-data --volume-type cephfs --json`

四、如何使用

CLI工具已发布到公司制品库(具体制品库可以联系AI平台获取),可直接下载使用

pip install prophet_cli==1.0.0 -i http://xxxx.xxxx.qihoo.net:8360/nexus/repository/xxxx/simple --trusted-host xxxx.xxxx.qihoo.net

CL操作命令遵循 prophet_cli <产品><类型><动作><参数>统一范式,从用户视角看,Prophet CLI的使用方式是非常直观的。它强调的是“统一理解、统一入口、统一动作”,而不是让用户去适应每个系统各自不同的交互逻辑。
通常只需要完成基础配置后,就可以通过统一命令入口访问不同平台能力。无论是查看资源、发起任务,还是管理训练相关操作,使用方式都遵循统一的命令组织逻辑。
这意味着一个用户一旦熟悉了这套使用方式,就可以比较自然地在不同能力域之间切换,而不需要重新学习多套完全不同的入口模式。对于希望提升平台整体体验的产品来说,这种统一性往往比单点功能更重要。

下面介绍几个详细使用方式:

首先要设置好环境变量,这是使用CLI工具的必须凭证,用于告诉CLI你是谁,你要在哪个项目下执行操作。

export PROPHET_PROJECT_ID="your-project-id"    # 项目IDexport PROPHET_AK="your-access-key"            # Access Keyexport PROPHET_SK="your-secret-key"            # Secret Key

4.1 CLI操作

1、创建交互式建模任务

prophet_cli tai notebook create --name test0422 --volume-name dbn-shcdt --volume-type cephfs --mount-path /home/jovyan/test --json

2、创建分布式训练任务

tai job create --name qwen-inference-service-0422 --cluster shcdt --job-type rayjob --series "A100-80G-标准版" --volume-name   dbn-shcdt --volume-type cephfs --command "vllm serve /xxx/huggingface/Qwen/Qwen2___5-7B-Instruct   --host 0.0.0.0 --port 8000 --trust-remote-code" --description "Qwen2.5-7B推理服务"

3、创建模型微调任务

prophet_cli tlm train create --name sft-test0422 --dataset-name 弱智吧精选问题数据集 --model-base-name Qwen2.5 --model-scale 7B --training-method sft --resource-config '{"cluster": "zzzc2", "series":"A100-80G-标准版", "series_count": 2}'

4、创建模型蒸馏任务

prophet_cli tlm distill create --name distill-test0422 --dataset-name 弱智吧精选问题数据集 --eval-dataset-name test --student-model-name Qwen2.5  --student-model-scale 7B --teacher-model-name Qwen2.5  --teacher-model-scale 72B  --resource-config '{"cluster": "zzzc2", "series":"A100-80G-标准版", "series_count": 2}'

4.2 Agent操作

将上述SKILL.md文档配置到你的Agent助手里面,下面是使用的ClaudeCode做的演示,智汇云版龙虾也已经打通与平台的连接,同样可以使用。

1、一句话启动交互式建模

“给我在tai平台创建一个notebook任务”

2、一句话启动分布式训练

“给我在tai平台创建一个rayjob任务,挂载dbn-shcdt盘,启动命令是通过vllm serve启动一个大模型,模型在xxxx/huggingface/Qwen/Qwen2___5-7B-Instruct”

3、一句话训模型

“给我在tlm平台上用“数学推理数据集”这个数据启动一个Qwen2.5 7B模型的LORA训练。”

五、从 CLI到Agent,平台正在发生什么变化

如果说过去的平台能力更多是“面向页面设计”的,那么现在的平台能力正在逐步转向“面向执行设计”。这不是简单把页面换成命令行,而是平台开始以“可调用、可组合、可扩展”的方式重新组织能力。CLI在这里扮演的,是一个非常关键的中间层角色:它承接人类用户的直接操作,也承接Agent的自动执行;它连接平台已有服务,也为未来更复杂的智能编排留下空间。这意味着,CLI化不是一个附属能力,而是在为平台的下一阶段演进打基础。随着平台继续向智能化、自动化和生态化方向发展,这样的统一操作层会变得越来越重要。

当平台进入Agent时代,真正重要的不是多了多少“智能入口”,而是平台是否具备足够稳定、统一、可执行的能力接口。Prophet CLI的价值就在于,它把平台操作从零散、分散、依赖经验的方式,逐步沉淀为统一、结构化、可复用的标准动作。这样的平台,不仅更适合人使用,也更适合Agent接入。

天纪大模型开发平台TLM产品地址:https://zyun.360.cn/product/tlm

END

360智汇云开发者公众号专注于为大家提供更多技术分享,

更多产品干货,

请移步“360智汇云”👇

360智汇云是以"汇聚数据价值,助力智能未来"为目标的企业应用开放服务平台,融合360丰富的产品、技术力量,为客户提供平台服务。目前,智汇云提供数据库、中间件、存储、大数据、人工智能、计算、网络、视联物联与通信等多种产品服务以及一站式解决方案。

官网:https://zyun.360.cn(复制在浏览器中打开)

更多好用又便宜的云产品,欢迎试用体验~

添加工作人员企业微信👇,get更快审核通道+产品免费试用包哦~

图片

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐