拥抱 Agent:用统一 CLI 打开天纪平台操作的新方式
一、背景
360 智汇云面向开发者,提供了覆盖大模型开发、评测、数据标注、AI 应用全流程开发,以及智能体构建与运行的完整底层 AI 基础设施服务。
在大模型能力层面,智汇云打造了 “天纪平台” 矩阵:
- 大模型开发 TLM:支持大模型的微调、训练,提供模型从 0 到 1 的构建能力;
- AI 评测平台 TEP:实现对大模型与智能体的全面评估;
- AI 标注平台 TLP:集成大模型标注与机器学习标注能力,为模型训练提供高质量数据支撑;
- AI 开发平台 TAI:提供全流程 AI 应用开发能力,降低 AI 落地门槛。
过去,天纪平台主要通过Web页面提供给用户使用。这样的方式直观、易理解,适合人工交互。但当平台能力逐步丰富,使用者角色不断增多,调用频次越来越高,页面就不再是最合适的唯一入口。
为什么是CLI呢?一方面,页面适合交互式操作,但不利于沉淀为标准流程。很多高频动作虽然可以在页面中完成,但它们往往依赖用户对平台路径、参数位置和操作顺序的熟悉程度。这种方式适合人工处理,却不利于自动化复用。另一方面,直接开放底层接口虽然灵活,但对使用者要求较高。调用者不仅要理解接口语义,还要处理参数组织、对象关系和认证配置,使用门槛相对较高。对于很多以任务目标为导向的使用者来说,他们更关心的是“我要创建什么”“我要查询什么”“我要管理什么”,而不是底层接口的组织方式。CLI正好处在页面和原始接口之间。它既比页面更结构化,又比底层接口更易用;既适合人工执行,也适合脚本和Agent调用。对于正在拥抱Agent的平台来说,这是一层非常关键的承接能力。更进一步看,CLI还有一个常被低估的价值:它天然具有“标准动作”的形态。一个页面路径可能会随着交互设计不断变化,但一个命令一旦被定义清楚,就更适合作为长期稳定的操作约定。这也是平台能力能够逐步走向自动化和智能化的基础。
再往前一步,当Agent开始参与任务拆解、步骤编排和动作执行时,平台更需要一种比页面更稳定、更结构化的交互方式。Agent需要的不是一个只能“看”的平台,而是一个可以“执行”的平台。它需要稳定、结构化、可调用、可编排的操作接口,来承接从意图理解到动作落地的完整链路。换句话说,平台如果希望真正进入Agent时代,就不仅要有能力展示层,还要有能力执行层。
在这样的背景下,平台选择将核心操作能力进一步沉淀为统一CLI。它不是简单增加一个命令行工具,而是在平台层构建一个同时面向人和Agent的标准执行接口。这个变化背后,意味着平台能力开始从“面向页面组织”逐步走向“面向执行组织”,从而让平台更容易被理解、被调用、被复用,也更容易被接入更广泛的自动化体系。
二、Prophet CLI想解决什么问题
Prophet CLI的目标,不是把页面能力简单搬到命令行,而是把平台操作沉淀为一组清晰、统一、可复用的标准动作。如果从平台演进角度看,这种沉淀有点像为平台补上一层“通用操作语言”。当各种平台能力都能被表达成一致的命令形态时,用户理解成本会下降,团队协作会更顺畅,Agent也更容易真正成为平台的一部分。
它重点解决以下几个问题:
第一,统一入口。
平台往往会逐步扩展出多条产品线和多类能力,如果每类能力各自发展,用户和调用方都会面临入口分散、认知割裂的问题。统一 CLI能把这些能力收敛到同一个操作体系中,让平台从“多个工具集合”走向“一个有组织的能力系统”。
第二,降低复杂度。
很多平台动作背后都涉及参数组合、资源选择、对象匹配等细节。CLI可以把这些复杂度收敛到更贴近业务语义的命令中,让使用者以更自然的方式表达目标。对于使用者而言,重要的是完成任务,而不是学习平台内部所有细节。
第三,增强复用性。
当一个动作被沉淀为标准命令后,它就不再只是“某个人会做的一套页面操作”,而是一个可以被不同人、不同脚本、不同Agent反复调用的标准能力。这种复用,不只体现在调用层面,也体现在认知层面和协作层面。
第四,为Agent提供执行平面。
Agent的价值不只是辅助理解,更重要的是能否稳定执行。CLI提供了天然结构化的执行接口,让Agent更容易把用户意图转成具体动作,也让平台具备把“建议”落地为“执行”的可能性。
三、设计思路
3.1 Prophet CLI
Prophet CLI的核心思路可以概括为一句话:统一入口、按域组织、按动作执行。
在使用体验上,平台为不同产品能力提供统一命令入口,让用户在同一套命令体系中完成不同场景下的操作。无论是资源类能力、训练类能力,还是后续扩展的新能力,都可以纳入一致的使用方式中。
这种一致性并不只是“形式统一”这么简单。它意味着平台在对外表达能力时,开始采用统一的心智模型:用户只需要理解“我正在操作哪个对象,我要对它做什么”,而不需要在不同系统之间频繁切换思维方式。
```textprophet/ ├── __init__.py ├── prophet_cli.py ├── setup.py └── products/ ├── __init__.py ├── tai/ │ ├── __init__.py │ ├── cli.py │ └── core/ ├── tlm/ │ ├── __init__.py │ ├── cli.py │ └── core/ └── tlg/ ├── __init__.py ├── cli.py └── core/```
从架构设计看,这套 CLI不是一个单点工具,而是一个可扩展的操作层。它在上层提供统一入口,在中间按产品和能力域组织命令,在下层对接平台已有服务能力。这样做的好处是,平台既能保持整体一致性,又能为不同能力保留独立演进空间。
对平台而言,这种设计还有一个很重要的现实意义:当能力逐步增多时,平台不必反复重新设计用户入口,而是可以在统一框架内持续生长。对于外部合作伙伴、生态接入方和自动化系统来说,这种稳定性同样是非常重要的。
如果把它抽象成一个简单架构,可以理解为三层:
1. 统一入口层
提供统一命令入口,承接用户和Agent的操作请求。
2. 能力组织层
按产品、场景和动作组织命令,把平台能力表达成易理解、易调用的结构。
3. 平台服务层
由已有平台服务承接具体执行,CLI负责把操作意图转换成标准调用。
这种分层方式的价值在于,它既能保证使用体验统一,也能保证平台能力持续演进时不会互相牵制。平台可以在不改变整体对外形态的前提下,持续扩展新的能力域和新的操作对象。
3.2 Agent SKILL
我们提供了对应的SKILL,可以轻易的接入主流Agent工具,包括但不限于ClaudeCode、CodeX、OpenClaw、Copilot Code等等。
将平台的能力开放给Agent时,最担心的往往是“不可控”与“瞎编造”。为此,我们在底层注入了这套SKILL规范。这套规范教会Agent如何“克制”与“严谨”:它不会盲目自信地拼接长命令,而是会谦虚地先查阅 --help 文档;它懂得在创建任务前先去检索所需的资源;它知道用结构化的JSON来保障数据处理的精确度;它更懂得在面对高危操作时,停下来询问人类的意见,这不仅是一份命令指南,更是Agent在平台上安全作业的护栏。这套SKILL可以成功将一个聪明的 AI,塑造成一位严谨、安全、遵循标准SOP的平台工程师。
---name: prophet-clidescription: Prophet 平台的 TAI、TLM 相关 API 命令行接口。用于管理 notebook、存储卷、分布式训练、模型微调、强化训练和推理服务。version: 1.0.0triggers: - "tai平台" - "tlm平台" - "prophet平台" - "tai" - "tlm" - "prophet"---# Prophet CLI操作技能这是一个用于操作 Prophet 平台(包含 TAI 和 TLM)的技能。通过 `prophet` 命令行工具,可以管理底层计算资源和大模型相关的训练/推理任务。## 核心工作原则:渐进式命令探索**不要在没有确认参数的情况下猜测长命令的参数!** CLI的参数可能随着版本发生改变。请严格遵循以下**渐进式**步骤来完成用户的任务:1. **确定平台与模块**:根据用户需求,确定是使用 `tai` 还是 `tlm`,以及具体的子模块(如 `notebook`, `job`, `train`)。2. **获取命令帮助(必须)**:在执行创建、更新等复杂操作之前,**必须**先执行带有 `--help` 的命令来获取当前的准确参数列表。例如: ```bash prophet_cli tai notebook create --help prophet_cli tlm train create --help ```3. **收集前置信息**:很多命令需要明确的 `project-id`、`series`(资源规格)或 `dataset-name`。在创建之前,可以使用对应的 `list` 或 `list-series` 命令查询这些前置 ID/Name。4. **执行并解析**:执行命令时,为了方便 AI 解析结果,建议加上 `--json` 参数。5. **高危命令确认**:执行停止、删除、重启等高危命令时,必须让用户同意!!!不可自主决定!!!---## 平台能力总览### 1. TAI 平台 (`prophet_cli tai`)主要用于基础计算资源分配、交互式开发和常规分布式任务。所有操作一般需要提供 `--project-id`(或通过环境变量 `PROPHET_PROJECT_ID` 传入)。* **Notebook (`prophet_cli tai notebook`)**:交互式建模环境。 * `create`: 创建 notebook。资源规格支持传名称(如 `--series "CPU基础版" --series-count 4`)或直接传 ID。支持挂载多种类型存储卷。 * `list`: 列出 notebook。支持按状态、关键字分页查询。 * `get`: 获取详情。 * `update`: 更新配置(延长运行时长或更新描述等)。 * `stop`, `restart`: 停止(加上 `--purge` 可彻底删除)、重启。* **存储卷 (`prophet_cli tai volume`)**:管理 cephfs, polefs等存储卷。 * `list`: 列表查询,支持按挂载类型(type)、读写权限、集群或持有者(holder)过滤。 * `get`: 查询特定存储卷详情。 * `count`: 查询资源组/项目的存储卷数量。* **训练任务 (`prophet_cli tai job`)**:提交常规的 PyTorchJob 或 RayJob 分布式训练任务。 * `create`: 创建任务。需指定 `job-type` (`pytorchjob` 或 `rayjob`),同样支持传入资源规格名称及节点数。 * `list`: 列表查询,可按任务类型、运行状态(pending/running/succeeded/failed/interrupted)过滤。 * `get`: 获取详情。 * `update`: 更新配置描述。 * `stop`: 停止运行中的任务。### 2. TLM 平台 (`prophet_cli tlm`)主要用于大语言模型(LLM)的微调(SFT)、强化学习(RFT)、蒸馏(Distill)和数据集管理。* **大模型训练 (`prophet_cli tlm train`)**: * `create`: 创建大模型训练任务。**参数极其丰富,务必先看 `--help`**。 * 支持通过 `--model-base-name`(如 Qwen3)和 `--model-scale`(如 14B)自动补齐模型 ID、版本、来源等信息。 * 支持的 `--training-method` 包含:LORA, SFT, DPO, KTO, QLORA, FULL, RFT_PPO, RFT_GRPO 等。 * 数据集支持通过 `--dataset-name` 和 `--dataset-tag` 指定,CLI会自动在 square / my 数据集中查找匹配项。 * `--resource-config` 支持传入集群、资源规格名称和卡数,内部会自动尝试转换成 TAI 所需的规格 ID。 * `--train-config` 允许传入 JSON 配置学习率、epochs、rank、sequence_length 等超参数。 * `list`: 任务列表查询。 * `get`: 任务详情查询。 * `stop`: 停止训练。 * `save`: 将训练结果保存为模型资产。 * `delete`: 删除任务。 * `get-resource`: 根据模型规模、资源系列和训练方法查询推荐资源配置。 * `overview`, `list-lora`: 查询训练大盘和 LoRA 模型列表。* **模型蒸馏 (`prophet_cli tlm distill`)**: * `create`: 创建蒸馏任务。需要同时指定学生模型和教师模型: * `--student-model-name` / `--student-model-scale` * `--teacher-model-name` / `--teacher-model-scale` * 数据集支持: * `--dataset-name` + `--dataset-tag`:指定训练数据集; * `--eval-dataset-name` + `--eval-dataset-tag`:可选指定评测数据集; * `--resource-config`: 支持自定义蒸馏资源配置,也支持用资源规格名称 + 数量自动换算为 TAI 规格 ID。 * `--train-config`: 支持传入蒸馏超参数 JSON。 * `list`: 查看蒸馏任务列表。 * `get`: 查看蒸馏任务详情。 * `stop`: 停止蒸馏任务。 * `save`: 保存蒸馏产出的模型。 * `delete`: 删除蒸馏任务。* **数据集 (`prophet_cli tlm dataset`)**:模型微调和蒸馏所用数据集管理。 * `list`: 列表查询,支持查询公开库(square)或个人私有的数据集。 * `get`: 详情查询。---## 环境变量与配置执行命令前需要环境具备以下变量(如果用户没有提供,你可以提示用户设置):- `PROPHET_AK`: Access Key- `PROPHET_SK`: Secret Key- `PROPHET_PROJECT_ID`: 默认项目 ID---## 实战示例**场景:用户让你在 TAI 平台上创建一个挂载了 test-data 存储卷的 notebook**1. 你首先确认需要用到的命令是 `prophet_cli tai notebook create`2. 运行 `prophet_cli tai notebook create --help` 获取精确的参数选项。3. 发现需要 `project-id`, `cluster`, `series` 等必填项,若用户未提供,你可以使用 `prophet_cli tai notebook list-series` 查看有哪些资源,并向用户确认。4. 结合 `--help` 里的说明,构建并执行完整的命令: `prophet_cli tai notebook create --name test-nb --cluster bjzdt --series "CPU基础版" --series-count 4 --volume-name test-data --volume-type cephfs --json`
四、如何使用
CLI工具已发布到公司制品库(具体制品库可以联系AI平台获取),可直接下载使用
pip install prophet_cli==1.0.0 -i http://xxxx.xxxx.qihoo.net:8360/nexus/repository/xxxx/simple --trusted-host xxxx.xxxx.qihoo.net
CL操作命令遵循 prophet_cli <产品><类型><动作><参数>统一范式,从用户视角看,Prophet CLI的使用方式是非常直观的。它强调的是“统一理解、统一入口、统一动作”,而不是让用户去适应每个系统各自不同的交互逻辑。
通常只需要完成基础配置后,就可以通过统一命令入口访问不同平台能力。无论是查看资源、发起任务,还是管理训练相关操作,使用方式都遵循统一的命令组织逻辑。
这意味着一个用户一旦熟悉了这套使用方式,就可以比较自然地在不同能力域之间切换,而不需要重新学习多套完全不同的入口模式。对于希望提升平台整体体验的产品来说,这种统一性往往比单点功能更重要。
下面介绍几个详细使用方式:
首先要设置好环境变量,这是使用CLI工具的必须凭证,用于告诉CLI你是谁,你要在哪个项目下执行操作。
export PROPHET_PROJECT_ID="your-project-id" # 项目IDexport PROPHET_AK="your-access-key" # Access Keyexport PROPHET_SK="your-secret-key" # Secret Key
4.1 CLI操作
1、创建交互式建模任务
prophet_cli tai notebook create --name test0422 --volume-name dbn-shcdt --volume-type cephfs --mount-path /home/jovyan/test --json

2、创建分布式训练任务
tai job create --name qwen-inference-service-0422 --cluster shcdt --job-type rayjob --series "A100-80G-标准版" --volume-name dbn-shcdt --volume-type cephfs --command "vllm serve /xxx/huggingface/Qwen/Qwen2___5-7B-Instruct --host 0.0.0.0 --port 8000 --trust-remote-code" --description "Qwen2.5-7B推理服务"

3、创建模型微调任务
prophet_cli tlm train create --name sft-test0422 --dataset-name 弱智吧精选问题数据集 --model-base-name Qwen2.5 --model-scale 7B --training-method sft --resource-config '{"cluster": "zzzc2", "series":"A100-80G-标准版", "series_count": 2}'

4、创建模型蒸馏任务
prophet_cli tlm distill create --name distill-test0422 --dataset-name 弱智吧精选问题数据集 --eval-dataset-name test --student-model-name Qwen2.5 --student-model-scale 7B --teacher-model-name Qwen2.5 --teacher-model-scale 72B --resource-config '{"cluster": "zzzc2", "series":"A100-80G-标准版", "series_count": 2}'

4.2 Agent操作
将上述SKILL.md文档配置到你的Agent助手里面,下面是使用的ClaudeCode做的演示,智汇云版龙虾也已经打通与平台的连接,同样可以使用。
1、一句话启动交互式建模
“给我在tai平台创建一个notebook任务”

2、一句话启动分布式训练
“给我在tai平台创建一个rayjob任务,挂载dbn-shcdt盘,启动命令是通过vllm serve启动一个大模型,模型在xxxx/huggingface/Qwen/Qwen2___5-7B-Instruct”


3、一句话训模型
“给我在tlm平台上用“数学推理数据集”这个数据启动一个Qwen2.5 7B模型的LORA训练。”


五、从 CLI到Agent,平台正在发生什么变化
如果说过去的平台能力更多是“面向页面设计”的,那么现在的平台能力正在逐步转向“面向执行设计”。这不是简单把页面换成命令行,而是平台开始以“可调用、可组合、可扩展”的方式重新组织能力。CLI在这里扮演的,是一个非常关键的中间层角色:它承接人类用户的直接操作,也承接Agent的自动执行;它连接平台已有服务,也为未来更复杂的智能编排留下空间。这意味着,CLI化不是一个附属能力,而是在为平台的下一阶段演进打基础。随着平台继续向智能化、自动化和生态化方向发展,这样的统一操作层会变得越来越重要。
当平台进入Agent时代,真正重要的不是多了多少“智能入口”,而是平台是否具备足够稳定、统一、可执行的能力接口。Prophet CLI的价值就在于,它把平台操作从零散、分散、依赖经验的方式,逐步沉淀为统一、结构化、可复用的标准动作。这样的平台,不仅更适合人使用,也更适合Agent接入。
天纪大模型开发平台TLM产品地址:https://zyun.360.cn/product/tlm
END
360智汇云开发者公众号专注于为大家提供更多技术分享,
更多产品干货,
请移步“360智汇云”👇
360智汇云是以"汇聚数据价值,助力智能未来"为目标的企业应用开放服务平台,融合360丰富的产品、技术力量,为客户提供平台服务。目前,智汇云提供数据库、中间件、存储、大数据、人工智能、计算、网络、视联物联与通信等多种产品服务以及一站式解决方案。
官网:https://zyun.360.cn(复制在浏览器中打开)
更多好用又便宜的云产品,欢迎试用体验~
添加工作人员企业微信👇,get更快审核通道+产品免费试用包哦~

更多推荐


所有评论(0)