Havenlon|AI 时代的执行安全语言体系(七三):人工停顿与执行摩擦
Working Draft · AI Era Execution Security Language
This article is part of the Havenlon Execution Security Language project.
The terminology and definitions presented here describe the current
working draft and may evolve as the discipline matures.AI 时代执行安全语言体系(工作草案)
本系列旨在建立 AI 时代执行安全的共同语言。
本文中的术语与定义代表当前工作草案,
将随着理论研究、工程实践和社区讨论持续修订
25. Artificial Pause|人工停顿
一句话定义
人工停顿,是在自动化执行链中人为设置的等待、确认、冷静期或状态切换,用于阻止动作连续无摩擦推进的机制。
严格定义
Artificial Pause 可以包括:
- 等待人工确认;
- 冷静期;
- 延迟执行;
- 二次确认;
- 独立通道确认;
- 分阶段 Commit;
- 高风险队列;
- 异常冻结;
- 物理操作。
人工停顿的价值不是让系统变慢,而是:
- 让状态有时间暴露;
- 让人类有机会发现异常;
- 让 Policy 更新;
- 让外部状态确认;
- 让撤销能够生效;
- 打断自动化级联;
- 阻止攻击在机器速度下连续传播。
上位概念
- Execution Control
- Temporal Constraint
下位概念
- Approval Pause
- Cooling-Off Period
- Pre-Commit Pause
- Recovery Pause
- Escalation Pause
相关概念
- TimeGuard
- Human-in-the-Loop
- Execution Friction
- Safe Interruption
- Two-Phase Commit
权力边界
Agent 或应用不能因为任务紧急自行跳过预设停顿。
约束机制
- 固定延迟;
- 时间锁;
- 人工确认;
- 独立设备;
- 冷静期;
- 超时失效;
- 停顿证据。
结果目标
在机器连续执行中重新引入可观察、可拒绝和可撤销的时间边界。
在 Havenlon 中
高风险治理和执行可通过 Confirm、冷静期和物理确认形成受控人工停顿。
26. Execution Friction|执行摩擦
一句话定义
执行摩擦,是为降低错误、滥用和自动化级联风险而有意设置的额外步骤、限制、等待或确认成本。
严格定义
执行摩擦可以表现为:
- 多一步确认;
- 降低自动化额度;
- 限制工具数量;
- 增加物理动作;
- 要求独立审批;
- 限制频率;
- 需要上下文复核;
- 设置冷静期;
- 要求设备签名。
传统产品设计通常将摩擦视为需要消除的障碍。
但在高风险执行中:
完全无摩擦往往意味着错误也可以无摩擦地变成现实结果。
安全摩擦应当:
- 与风险成比例;
- 对低风险尽量轻;
- 对高风险明确存在;
- 可预测;
- 不可被静默绕过;
- 不依赖无意义重复点击。
上位概念
- Safety Control
- Human Factors
下位概念
- Approval Friction
- Temporal Friction
- Physical Friction
- Governance Friction
- Tool Friction
相关概念
- Artificial Pause
- Risk-Based Control
- Human-in-the-Loop
- User Experience
- Blast Radius
权力边界
效率优化不能无条件删除承担安全作用的执行摩擦。
约束机制
- 风险分级;
- 动态阈值;
- 高风险升级;
- 物理确认;
- 多方治理;
- 延迟;
- 清晰展示。
结果目标
将有限的人类注意力和系统成本集中到真正可能造成大规模损失的执行点。
在 Havenlon 中
低风险动作保持低摩擦,高风险、治理和恢复动作保留明确执行摩擦。
27. Missing Human Pause|人工停顿消失
一句话定义
人工停顿消失,是原本由人类查看、确认、等待或手动衔接的步骤被 Agent 和自动化连续执行替代的现象。
严格定义
过去很多系统并没有正式安全边界,却依赖隐含人工停顿:
- 人员切换系统;
- 手工复制参数;
- 等待审批消息;
- 手动登录;
- 人工核对对象;
- 分部门交接;
- 工作时间限制;
- 操作员犹豫。
这些停顿不稳定,也不一定可靠,但它们客观上限制了:
- 执行速度;
- 传播范围;
- 重试次数;
- 连续动作;
- 错误扩散。
AI Agent 消灭这些停顿后,系统可能在没有建立正式边界的情况下获得连续执行能力。
上位概念
- Automation Transformation
- Agentic Risk
下位概念
- Approval Pause Removal
- Handoff Removal
- Manual Review Removal
- Sequential Friction Removal
相关概念
- Artificial Pause
- Execution Friction
- Automation Cascade
- Machine Speed
- Human-Out-of-the-Loop
权力边界
消除人工停顿之前,必须明确由什么技术和治理边界替代它。
约束机制
- 风险重评估;
- 正式执行边界;
- 速率和范围限制;
- Two-Phase Commit;
- 自动熔断;
- 高风险人工确认;
- Evidence。
结果目标
让自动化替代低效人工操作时,不同时删除原本承担风险缓冲作用的全部停顿。
在 Havenlon 中
Havenlon 用正式的执行前控制、提交机制和物理拒绝替代偶然存在的人工停顿。
AI Agent 执行关系总图
Human / Organization Goal
↓
Agent Context
↓
Agent Planning
↓
Agent Intent
↓
Tool Selection
↓
Tool Call Candidate
↓
Tool Execution Boundary
↓
Execution Intent
↓
Approval / Policy / Arbitration
↓
Final Revalidation
↓
Device-Signed Commit
↓
Restricted Executor
↓
Receipt / Evidence
核心分界是:
Model Output
≠
Execution Authority
Agent 权力结构
Agent Identity
↓
Agent Authority
│
├── Read
├── Plan
├── Propose
├── Select Tool
├── Request Tool Call
└── Limited Autonomous Execution
不能自动包含:
Unlimited Tool Access
Unlimited Scope
Governance Change
Recovery Authority
Final Execution Authority
Tool Call 与真实执行的区别
Tool Call Generation
模型生成了一个调用结构
Tool Permission
Agent 是否有资格提出此类调用
Tool Authorization
当前 Intent 是否允许使用该工具
Tool Commitment
系统是否形成正式执行提交
Tool Execution
工具是否实际改变外部状态
Tool Receipt
外部系统返回了什么
Tool Evidence
如何证明完整过程
因此:
合法的 Tool Call 只是格式正确的候选动作,不是现实执行许可。
AI Agent 灾难路径
Prompt Injection
↓
Agent Goal 被改变
↓
Agent 生成恶意 Tool Call
↓
Agent 拥有宽泛 API Token
↓
工具无独立执行边界
↓
连续调用多个系统
↓
Automation Cascade
↓
灾难性执行
Havenlon 的阻断路径是:
Prompt Injection
↓
最多污染 Agent Proposal
↓
Tool Call 转换为 Execution Intent
↓
Tool Permission 与 Scope 验证
↓
Policy / Governance
↓
Amount / Rate / Scope Limit
↓
Final Revalidation
↓
Independent Final Veto
自动化级联控制
Agent 执行失败
↓
Retry Counter +1
↓
重新读取当前状态
↓
判断是否允许重试
│
├── 状态明确未执行
│ → 幂等重试
│
├── 状态未知
│ → 冻结并核验
│
└── 连续失败超阈值
→ Circuit Breaker
→ Safe Mode
同时限制:
Maximum Steps
Maximum Retries
Maximum Tool Depth
Maximum Amount
Maximum Scope
Maximum Execution Rate
三种人类参与模式
Human-in-the-Loop
人必须明确同意,执行才能继续。
Human-on-the-Loop
系统可以执行,但人持续监督并可中断。
Human-Out-of-the-Loop
系统在预授权的有限范围内自主执行。
它们不是成熟度高低关系,而是不同风险场景的治理选择。
人工停顿的替代关系
传统人工流程可能依赖:
手动切换系统
人工复制参数
等待消息
人工登录
操作员复核
AI Agent 消除这些步骤后,必须补上:
Intent Binding
Tool Execution Boundary
Rate Limit
Amount Limit
Scope Limit
Artificial Pause
Two-Phase Commit
Final Revalidation
Evidence Chain
否则,系统只是把低效率消除了,也把最后的风险缓冲一起消除了。
AI Agent 与自动化执行评审问题
评估一套 Agentic System 时,至少应回答:
- Agent 能够做什么?
- Agent 只是生成建议,还是能够调用工具?
- 哪些工具是只读?
- 哪些工具会改变真实状态?
- 哪些工具具有不可逆结果?
- Agent 是否拥有独立身份?
- 是否能够区分 Agent、用户和底层服务账户?
- Agent 权力是如何授予的?
- Agent Authority 是否可撤销?
- Agent 权力是否具有有效期?
- Agent 是否能够将权限委托给另一个 Agent?
- 再委托是否需要显式允许?
- Agent 是否可以修改自己的工具权限?
- Agent 是否可以修改 Policy?
- Agent 是否可以修改治理状态?
- Agent 是否可以进入恢复模式?
- Agent Intent 是否结构化?
- Agent Intent 是否引用用户原始目标?
- Agent 对目标的具体化是否需要确认?
- Tool Call 是否直接等于执行?
- 是否存在独立 Tool Execution Boundary?
- Tool Permission 是否按动作和对象细分?
- 是否使用宽泛长期 API Token?
- Agent 是否能够访问底层密钥?
- Agent 是否可以调用任意 Payload 签名?
- Tool Call 参数是否重新验证?
- Tool Call 是否绑定 IntentHash?
- Tool Call 是否绑定当前上下文?
- Prompt Injection 最多能影响到哪一层?
- 外部网页、邮件和文件是否被视为不可信上下文?
- Tool Result 是否可能包含注入内容?
- 记忆是否可能被污染?
- 关键事实是否由独立 Fact Source 提供?
- 模型输出是否被误认为事实?
- Agent Hallucination 是否可能直接触发执行?
- 多 Agent 之间是否共享凭证?
- 一个 Agent 的权限是否会自动传递给另一个 Agent?
- 自动化链最多可以执行多少步骤?
- Agent 可以调用多少层工具?
- 重试次数是否有限?
- 状态未知时是否允许自动重试?
- 是否存在 Automation Cascade 检测?
- 是否存在 Circuit Breaker?
- Rate Limit 是否按 Agent 和 Tool 分别实施?
- Amount Limit 是否限制累计损失?
- Scope Limit 是否限制对象和环境?
- Agent 是否可以自动扩大作用域?
- Human-in-the-Loop 出现在哪些动作?
- 人类审批是否看到最终对象和参数?
- 人类是否拥有真实拒绝能力?
- Human-on-the-Loop 是否拥有实时中断能力?
- Human-Out-of-the-Loop 只用于哪些低风险动作?
- 哪些人工停顿被自动化删除?
- 删除停顿后由什么正式控制替代?
- Artificial Pause 是否可以被 Agent 跳过?
- 执行摩擦是否与风险成比例?
- 高风险动作是否需要独立 Confirm?
- Agent 是否能单独形成 Device-Signed Commit?
- Agent Tool Call 是否经过 Final Revalidation?
- 执行结果是否形成独立 Evidence?
- Agent 是否能删除自己的执行记录?
- Agent 失陷后的最大灾难半径是多少?
- 一个 Prompt Injection 最多能影响多少对象?
- 一个错误 Tool Call 最快能够重复多少次?
- Agent 是否拥有单点灾难性执行能力?
如果这些问题没有明确答案,系统可能拥有先进的 Agent 能力,却仍然把模型输出直接连接到了现实世界。
本章核心公理
AI Agent 的根本风险,不是它会不会犯错,而是它的错误能否直接变成现实动作。
模型可以生成 Intent,但模型输出不是执行权。
Tool Call 是候选动作,不是最终执行许可。
Agent 拥有工具权限,不代表每一次调用都安全。
AI Agent 应当被视为高不确定性的 Proposer,而不是默认可信的 Executor。
机器发起只代表 Intent 来源于机器,不代表机器拥有审批和最终执行权。
委托执行不是复制委托者的全部权力,而是授予完成具体任务所需的最小能力。
Agent Authority 必须可分割、可撤销、不可自动扩张且不可无条件传递。
Prompt Injection 的危险不在于模型说错了什么,而在于被污染内容是否能够穿过工具链获得真实执行资格。
Agent Hallucination 应当停留在候选判断层,而不能直接进入现实执行层。
多 Agent 协作不能让权力沿任务委托自动继承。
自动化链中的每一个高风险步骤都必须重新绑定具体 Intent 和当前状态。
机器速度会放大执行效率,也会放大错误传播速度。
Rate Limit 限制错误传播速度,Amount Limit 限制最大损失,Scope Limit 限制影响范围。
人工停顿消失后,必须由正式执行边界替代,而不能假设 Agent 会自动保持谨慎。
执行摩擦不是产品缺陷;在高风险执行中,它是阻止错误无摩擦进入现实的安全结构。
Human-in-the-Loop 负责逐次判断,Human-on-the-Loop 负责监督和中断,Human-Out-of-the-Loop 只能存在于有界自治范围内。
人在回路中不是多一个确认按钮,而是人类拥有真实、绑定具体 Intent 的拒绝能力。
Agent 可以自主规划,但不能自主扩大权限。
Agent 可以连续工作,但不能无限连续执行。
任何 AI Agent、自动化链或多 Agent 系统,都不应独自拥有灾难性执行能力。
Havenlon 对 AI Agent 与自动化执行的基本回应
Havenlon 不把 AI Agent 视为天然可信的新型管理员,也不把 Tool Calling 直接视为真实执行。
它要求:
- 将 AI Agent 识别为独立机器身份;
- 区分用户身份、Agent Identity 和底层服务凭证;
- 将 Agent 默认定义为 Proposer;
- 将 Agent 输出转化为结构化 Agent Intent;
- 让 Agent Intent 引用原始目标和当前上下文;
- 不让自然语言推理直接进入 Executor;
- 将 Tool Call 视为执行候选;
- 将 Tool Permission 拆分到动作、对象、时间和范围;
- 不把宽泛 API Token 直接交给 Agent;
- 将工具能力映射为有限 Execution Slot;
- 将工具使用绑定具体 IntentHash;
- 将工具参数绑定最终 Payload;
- 对高风险 Tool Call 进行独立 Authorization;
- 对不可逆 Tool Call 进行治理或人工审批;
- 让 Prompt Injection 最多影响 Agent Proposal;
- 不让外部上下文改变本地 Policy 和治理事实;
- 从独立 Fact Source 获取关键状态;
- 对 Agent Hallucination 进行事实与参数验证;
- 不允许模型自我判断替代最终安全判断;
- 让 Agent Authority 可撤销并具有有效期;
- 禁止 Agent 自主扩大权限;
- 禁止权限在多 Agent 之间自动继承;
- 对 Agent-to-Agent Delegation 进行显式约束;
- 限制自动化链最大步骤数;
- 限制 Agent 最大工具深度;
- 限制自动重试次数;
- 状态模糊时禁止自动重试;
- 使用 Rate Limit 限制机器执行速度;
- 使用 Amount Limit 限制最大现实损失;
- 使用 Scope Limit 限制影响对象;
- 使用 TimeGuard 限制执行窗口;
- 对异常反馈循环实施 Circuit Breaker;
- 对自动化级联进入 Restricted Mode 或 Safe Mode;
- 在高风险执行中保留 Artificial Pause;
- 用 Two-Phase Commit 分离提议与最终提交;
- 对高风险动作使用 Human-in-the-Loop;
- 对低风险自动化使用 Human-on-the-Loop;
- 仅在有界、低风险场景允许 Human-Out-of-the-Loop;
- 让人类拥有真实中断和拒绝能力;
- 在工具执行前完成 Final Revalidation;
- 让 Agent 无法直接形成最终设备提交;
- 让 Device-Signed Commit 来自独立执行边界;
- 让 Tool Result、Receipt 和执行事实进入 Evidence Chain;
- 让 Agent 不能删除或重写自身执行证据;
- 计算单个 Agent、单个 Prompt Injection 和单条自动化链的灾难半径;
- 确保任何 Agent 失陷后都不能独自完成灾难性执行。
最终原则是:
Havenlon 不阻止 AI Agent 行动。
它阻止的是模型的推理结果未经独立约束,直接获得改变现实的最终权力。
AI Agent 可以在机器速度下提出、规划和协作,但现实执行必须保持有界、可拒绝、可中断和可证明。
机器可以替人行动,但不能替系统取消边界。
更多推荐


所有评论(0)