跳转至

阶段四重新开启:AI BOSS 智能编排、通用成果与验收闭环

2026-08-15 对话统一操作与人类结果投影收口

  • 2026-08-16,审核未通过后的返工改为“先制定修正方案,再执行修正方案”:AI BOSS 审核失败只创建并保留一条 rework_clarification 修正版本,不能按旧输入直接运行。Benson 必须在原主题对话中说明要修改的内容、补充的证据或验收要求;Runtime 记录该说明后,才使用当前 Worker 默认通道重新冻结修正版本并置为 queued。旧的无说明排队返工在 Runtime 启动时自动迁入等待修正方案,历史任务、成果、证据与审计均保留。原任务显示“原执行通道”,修正版本显示“修正执行通道”,避免把旧计划快照误认为当前 Worker 设置。提交 3dc0e5f 的 Runtime、Console 与 Docs Actions 均成功并完成生产部署;三容器 OCI revision 为该提交,Runtime quick_check=ok,遗留无说明排队返工为 0,迁入等待修正方案的历史返工为 1

  • 2026-08-16,提交 7e07f87 已完成生产发布与验收。GitHub Actions RuntimeConsoleDocs 均成功;部署前 Runtime SQLite 备份 runtime-pre-benson-work-actions-7e07f87-20260815T155228Z.db 的 SHA-256 为 afbf173aaea8a1d406dc1bd35da464a4ae9ba57278b0a33d3fe51d138567ac91,备份与发布后数据库 quick_check=ok,权限均为 root:root 0600。生产 Runtime、Console、Docs 容器的 OCI revision 都是 7e07f872f2e0441658aada9da5c06901c037fb0b,运行镜像摘要分别为 sha256:8cdbd46f8fee60ce65dac3e8ec0babc43791deeb42628d7a678c4f2fbdfb0341sha256:99e4f76a4386de737a945747846c26d66d44ace817db09bbc38382ec5e000394sha256:02dc4bcae0ae36e9acf09754752e104d624d04debd387f960023d27a5856f127

  • 生产功能验收:主题目录真实返回待处理、消息和交互统计;Context Manifest 返回显式分页字段;固定动作目录返回用途、范围、风险和预期结果。一次只读 system.diagnose 真实完成,结果为根分区 69%、可用内存 1.1 GiB、OmniRoute/Runtime/Console/Docs 4/4 健康。已通过管理员 API Key 换取 HttpOnly 会话,在公网 Console 实测 AI BOSS 五个工作区标签、Context Manifest 分页控件,桌面 1440 × 900 与移动 390 × 844 均无横向溢出;Console 的未登录健康入口正确重定向到认证页,Docs 公网健康与本页正文可读。没有在本轮触发模型调用、业务任务派发、成果验收决定或 P5 主动循环。

  • AI BOSS 对话页成为 Benson 的唯一工作操作入口:执行、暂停、恢复、取消、重新审核、返工、计划取消/重新规划,以及成果通过、返工、拒绝和重新打开,均在所属主题的“当前结果”中完成,并继续调用 Runtime 原有接口、幂等键和状态机。任务页与“成果与验收”页只保留查询、筛选、证据、版本、审计和“回到对应对话处理”,不得复制第二套写操作。

  • 主题目录返回待处理数、消息数和模型交互数;待处理按人类决策单元计数,不重复计算同一任务及其待验收成果。主题切换时立即清空旧主题工作摘要并并行读取新主题对话与工作摘要,所有写按钮提交前再次核对摘要所属 conversation_id,避免短暂加载窗口误操作旧主题任务。
  • 记忆页拆分为主题历史、长期记忆和全历史 Context Manifest。长期记忆展示来源主题、来源消息、确认/替代/删除状态;Context Manifest 使用显式 limit/offset/total/has_more 分页,可继续加载更早记录,不再把最近 100 条静默冒充全历史。
  • 系统操作固定动作继续是 Runtime 到 root Operation Bridge 的白名单能力,不开放任意 Shell。目录逐项说明用途、真实范围、风险和预期结果;执行前使用 Console 自定义确认框,执行后首先显示人类摘要与下一步,原始状态、引用和字段折叠为技术详情。system.diagnose 的真实范围明确为根分区、内存、负载以及 OmniRoute、Runtime、Console、Docs 四个固定健康端点,不再使用笼统“系统诊断”表述。
  • 已验收成果的“重新打开”仍属于 Benson 操作,但在对话中折叠为历史入口,避免淹没真正待确认项。合法任务状态 planningwaiting_toolprecondition_changed 均有明确中文过程与下一步,系统操作查询失败或超过 60 秒会显示审计引用并说明后台可能仍在执行,不再伪装成正常结束。
  • 当前仓库验证:AI Runtime 全量 161 passed,其中新增分页专项 2 passed;System Operations Bridge 14 passed,Console 静态、嵌入和浏览器契约通过,JavaScript/Python 语法与 git diff --check 通过。该记录只证明本地仓库实现;GitHub Actions、生产部署、公网管理员浏览器和生产 SQLite 验收须在本次发布后补记。P5 仍为规划中,未启动定时、事件或主动循环。

2026-08-14 前置工作台与主题收口

  • conversation_id 已扩展为持久主题容器:保留原 ID,并增加标题、状态、归档时间和主题摘要;历史会话自动迁移为“未命名主题”。主题可继续对话、重命名、归档和恢复;清空主题上下文只移除消息与滚动摘要,不删除确认记忆、任务、成果、证据或审计。
  • interaction_id 保持一次用户提交与模型调用生命周期的含义。Console 对话消息显示交互 ID、模型通道、实际 Provider/模型和调用状态,并可关联 Context Manifest;模型切换不改变 Runtime 作为上下文与长期记忆唯一权威的边界。
  • Console 将“模型核心概览”更名为“AI 平台运行概览”,展示 Runtime、官方 OmniRoute、CLI Gateway、角色当前通道、通道可用性与脱敏观测时间。官方 OmniRoute Dashboard 继续承担 Provider 原始管理。
  • 成果与验收改为桌面列表/详情双栏,移动端回落为单栏;访问接口区分 Cloudreve 正式入口、已验收公开 URL/Git、Runtime SQLite 已认证安全预览和不可访问原因,禁止把受限成果误报为云盘故障。
  • 文档 iframe 继续以浏览器实际 load 事件为成功依据;超时仅显示“加载缓慢”并提供重试和新窗口,不把一次慢加载判定为永久入口失败。

状态:已完成并归档(最终事实、生产证据与后续边界见阶段四最终完成归档;本页保留为重新开启期间的唯一权威实施记录)

本文是阶段四重新开启后的唯一权威文件和细化页。它冻结 AI BOSS 智能编排、通用成果登记、证据、确定性检查、AI BOSS 审核、Benson 决策、Console 成果中心以及最终交付闭环的产品和工程边界。旧阶段四中已经通过真实验收的交互、预算、上下文、记忆、附件、多模态、CLI Gateway 和 API Gateway 能力继续有效;本页不把它们改写为未完成,也不把本页中的新增设计误报为已经实现。

旧稳定地址 阶段四:AI BOSS 核心能力、工作台与 API Gateway 可见性改造继续作为兼容入口;原有事实和证据保留在原阶段四完成归档。本页定义的重新开启出口已通过并已创建新的阶段四最终完成归档阶段五:AI BOSS 受控主动工作循环仅恢复为规划中,尚未实施。

一、权威记录与状态口径

1.0 实施记录

  • 2026-08-15,工作台可用性收口提交 5b69873 已经 GitHub Runtime/Console Actions 成功构建并部署。Runtime 新增主题级 GET /boss/v1/conversations/{conversation_id}/work-summary,将现有 Plan、Task、成果、检查和 AI BOSS 审核投影为人类可读的当前阶段、结果、原因、执行通道/实际模型和下一步;Console 对话页将其作为“当前结果”首屏,并把任务 ID、时间线和其他技术引用折叠到详情。确认草案后,AI_RUNTIME_P4_AUTO_EXECUTION_ENABLED=true 仅自动派发低风险、主节点、无外部来源的初始内部分析任务;返工、高风险、外部/Nomad、依赖未满足任务仍保持可见并等待对应决定。Runtime 重启恢复使用同一资格判断。该直接确认后派发不创建定时器、事件触发或后台主动循环,P5 仍未实施。部署前 SQLite 备份为 runtime-pre-human-work-summary-20260815T134234Z.db,SHA-256 b0993891c4ab68413082a953d097e233d6a72e6e7e9f754c7d26df45230a511b;生产 Runtime/Console 健康、quick_check=ok、摘要接口 HTTP 200 和本机 Console 新脚本均通过。

  • 2026-08-15,计划模式改为“草案优先、Benson 确认后落库”:POST /boss/v1/plan-drafts 复用智能规划的模型、预算预留、严格 JSON 契约、能力目录和数据等级校验,但只持久化 boss_plan_drafts,不得创建任务、成果、Nomad Job 或执行记录。草案保存原始请求、冻结契约、模型调用、预算/能力快照和可选的 supersedes_draft_id;替代草案带入同主题最近讨论与被替代草案摘要。每份草案显示在所属主题对话内,Benson 可继续讨论、生成替代草案或明确确认;POST /boss/v1/plan-drafts/{draft_id}/confirm 才在同一 SQLite 事务内创建正式不可变 Plan、任务图、模型调用关联并更新草案状态。确认一份后,同主题其余未确认草案标为 superseded 且继续可见、不可确认。确认仍不派发任务,AI_RUNTIME_P4_AUTO_EXECUTION_ENABLED=false 与 P5 未启用保持不变。

  • 2026-08-14,新的无外部副作用两步验收计划 8feabe4e395e46dea38f94e8b43ecfce 在生产真实运行:规划模型生成两个主节点 boss.reasoning/v1 步骤,根任务 f53f2747bd8f44d8 只有在 runtime.artifact-integrity/v1boss.review/v1 均通过、成果进入 accepted 后,后置 ba6aef777d244bde 才从 blocked_dependency 变为 queued;全局自动执行继续关闭,后置必须由 Benson 显式派发。两个任务均最终 completed,各有可访问 artifact_hash 证据、已接受成果与一次模型预留/真实结算;后置同键重放返回 replayed=true,没有第二次运行。对前置成果的 Benson reopen 正确把已完成后置改为 precondition_changed,并创建版本 2 的替代成果,原版本保留。该真实演练随后暴露返工子任务把累计 rework_round 重置为 0 的缺陷:第二次审核失败会错误创建额外队列。为停止额外模型消费,演练中的第二个排队返工已显式取消;没有触及四条历史 Benson 收件箱记录。

  • 2026-08-14,返工上限缺陷已由 214b5a3 修复并推送。Runtime Actions 31783514531 成功;新增回归覆盖 0 -> 1 -> 2 -> failed,与 P4 定向回归共 56 passed。生产部署前 SQLite 备份为 p4-rework-limit-before-214b5a3-20260814T082225Z.db,SHA-256 cec395bf0716fbc3330c700b413e6914f1c03016e151be41bae69d4ea77dd4b3;Runtime 已切换为 ghcr.io/michaellab7284/agentmeshos-ai-runtime:sha-214b5a3(image ID sha256:94f4fb2cdecb44b0ab8638b0dd394fa5eb088c901a7b705984cfd9fcdb00b00b),健康与 SQLite quick_check=ok。智能规划、检查器、自动验收和 web-verifier/v1 继续启用;AI_RUNTIME_P4_AUTO_EXECUTION_ENABLED=false 与 P5 未启用保持不变。剩余最终出口不再是旧批次仓库实现,而是:两个无依赖任务的真实并发、Cloudreve 长期写入后回读哈希、CSV/APP 包等常见成果实测、已登录 Console 的完整主题/成果浏览器验收,以及在当前 Runtime 版本上复核重启恢复和最终归档。

  • 2026-08-14,前置工作台与主题收口提交 bea7f7c 已通过 Runtime、Console 与 Docs Actions 317815471823178154722531781547237,并按 Runtime -> Console -> Docs 部署。部署前 Runtime SQLite 备份为 p4-topic-workspace-bea7f7c-20260814T155547.db,SHA-256 f8478f584cdeca7894dd7334f8709e526eee804a2c4b24064adbc94757bbf3bc。生产 Runtime、Console、Docs 分别运行同一提交,镜像摘要为 sha256:3ad95ecfefa0687d59409949d2427ae69ba668f90062259727adb6ea66c34b01sha256:cdc011cc9edb981d131a636fa69aaa651a2ef2c429ecb56fe6da3605f4bd97f9sha256:4326725ab6e2830f6f6c71a31c720ca02e4bcf26f567d7c4b56d3d1c566011af。Runtime 主题目录、平台概览、SQLite 成果受认证预览、容器健康、数据库 quick_check=okroot:root 0600、Console 本机健康、Docs 公网正文均通过;三类 rollback 镜像保留,P4 自动执行和 P5 主动循环状态未改变。

  • 2026-08-11,批次 0 已以 17d2d8e 发布并完成 GitHub、Docs 镜像和公网正文验收。

  • 2026-08-11,批次 1 完成增量 SQLite 结构、旧数据只读投影、认证后默认关闭的 P4 读取接口、稳定游标和安全预览边界的本地实现;当前仍未对生产 Runtime SQLite 或功能开关写入,生产验收留在批次 6。
  • 批次 1 的当前本机证据包括旧库双初始化、quick_check、历史任务/Artifact 保真、敏感字段拒绝、功能开关、预览拒绝、同一读事务分页、游标稳定性,以及既有 Runtime、Gateway、Console 契约和计划状态检查回归。精确提交、CI 运行和远程状态必须在本批次提交后补记,不得以本地测试替代。
  • 2026-08-11,批次 1 实现提交为 8e27e4b,经 PR #2 合并为 6ac24a7。Runtime Actions 31451992462 成功,已发布但尚未部署的 Runtime 镜像索引摘要为 sha256:f98ced46238ed4469118dc51ab285ae4b1584645aa3e03f3dd6fc2b7445d18ca;同次 Docs Actions 31451992512 成功,Docs 镜像摘要为 sha256:6b878921fa5391d84702240beff1dd21f93b6fd361e8b824e30f3a012927fc97。生产 Runtime 与 Console 尚未切换到该版本。
  • 2026-08-11,批次 2 已完成本地实现:新增严格 Pydantic 计划契约、能力目录安全快照、一次 JSON 修复、DAG/并行/深度/资源/数据等级/预算验证、原子计划图写入、幂等键冲突保护和 /boss/v1/plans 写接口;旧 /boss/v1/intents/plan 在开关启用时返回持久 plan_id,默认开关仍关闭。
  • 批次 2 本地证据:专用规划契约测试 15 passed;Runtime 全量回归 85 passed;尚未提交、推送、运行 CI 或切换生产 Runtime,不能把本地批次 2 实现视为生产能力已启用。
  • 2026-08-11,批次 2 实现提交为 1c99cf0,经 PR #4 合并为 a7c9efe。Runtime Actions 31453291621 和 Docs Actions 31453291615 均成功;Runtime 镜像索引摘要为 sha256:a099b731564b52c1e0070e22115a6e4f92d881e368b3c3cde4bde7216616b4cf,Docs 镜像索引摘要为 sha256:802d66ca630147d7a97f75ce06f6b3564d1420aa4bf4d27517c8b0a83c73fc5f。这些镜像尚未部署生产,智能规划开关仍未启用。
  • 批次 2 证据记录提交 7249c3f 经 PR #5 合并为 0637995;Docs Actions 31453698544 成功,最终 Docs 镜像索引摘要为 sha256:e66e187095dfe184efec4ee5c32654ab557847997ecbb0255017cfd5a75c2683。该文档证据提交不改变 Runtime 镜像或生产开关状态。
  • 2026-08-11,批次 3 已完成 Runtime 轻量检查器的仓库实现:默认关闭的验证入口真实回读 SQLite Artifact,并检查大小、SHA-256、真实文件头、UTF-8、JSON、CSV、PDF、图片、ZIP/APK 的受限结构;检查运行、可访问证据和已绑定验收标准均会持久化。受限 Cloudreve Runtime 长期 Artifact 已具备回读完整性接口,但尚未在生产 WebDAV 对象上完成真实验收。Nomad 浏览器/DNS/TLS 验证 Worker、生产灰度和重启恢复证据仍未完成。
  • 2026-08-12,批次 2 执行驱动完成本地实现:新增持久 task_runs 记录、单任务原子领取、主节点固定模型执行、Nomad 计划任务一次性提交、协作式暂停/取消、显式重试和 Runtime 重启中断标记;自动执行由 AI_RUNTIME_P4_AUTO_EXECUTION_ENABLED 默认关闭。计划创建在开关开启时才派发无依赖任务,重复 client_request_id 不重复规划或消费;当前仅完成本地测试,未部署生产。
  • 2026-08-12,计划执行驱动经 PR #23 合并为 a894753。主分支 Runtime Actions 31556867303 与 Docs Actions 31556867309 均成功;Runtime 镜像索引摘要为 sha256:c34ad4099a44fb776eba48c3010bdf4fdb96a2583030957581f086c812e4f9ff。这些构建证据不等于生产发布,生产功能开关仍未启用。
  • 2026-08-12,批次 3 的网页验证器仓库骨架已建立于 tools/web-verifier:独立 Playwright 镜像、无凭据非 root 入口、公开 URL/重定向解析、HTTP 状态/文本/声明式选择器/截图契约及私网地址拒绝测试已完成本地实现。它尚未登记为 Runtime 可用能力,也未在 Nomad 或生产节点启用;节点级仅允许 DNS 与公网 80/443、DNS 重绑定防护和真实浏览器回归仍是批次 3 未完成出口。
  • 2026-08-12,网页验证器经 PR #24 合并为 afde0b3。Web Verifier Actions 31557717229、Runtime Actions 31557717257 与 Docs Actions 31557717238 均成功;验证 Worker 镜像摘要为 sha256:5bc561aa57f0a52615cc6b0e17414e9645d8faa877edbb40e8f94e0ac1b93ee0。镜像构建成功不构成节点隔离或生产验收,web-verifier/v1 继续不可用。
  • 2026-08-12,Worker pcdell-103 已完成网页验证器专属 Docker 子网 172.31.250.0/24 的节点级出口隔离验收:独立 DOCKER-USER 跳转与 agentmeshos-web-verifier-egress.service 只匹配该子网;规则按顺序拒绝私网、Tailnet、回环、链路本地与云元数据,只允许 DNS 和 TCP 80/443。真实容器验证了 https://example.com 可访问,100.64.0.1100.64.0.5192.168.2.1169.254.169.254 被拒绝;重启 Docker 后 service、规则和允许/拒绝结果均恢复。验证器同时固定 HTTP/TLS 连接到已校验的 IPv4 地址,并在每次重定向重新校验目标,防止 DNS 重绑定。该节点到 Docker Hub 的 IPv4 与 IPv6 均超时,故真实 Playwright 镜像仍未拉取、Nomad 任务包未登记,web-verifier/v1 继续不可用,不能将网络隔离验收误写为 Worker 已发布。
  • 2026-08-12,网页验证器的合并提交 3a157ff 已通过 GitHub Web Verifier Actions 31564281507,镜像摘要为 sha256:b79ed29190e517ed34c89dfe6cd3e2deb0a3deece1af016bafd37575443ca6e0。Worker 103 能连通 GHCR,但没有 Docker pull 凭据,拉取返回标准 unauthorized;不能把主机 GitHub 写入 Token、Runtime Token 或任何凭据放进 Worker、Nomad Job 或容器。验证器将使用主机 root-only 的最小 read:packages 拉取身份。由于专网正确拒绝 Runtime/Tailnet 回调,结果不得经现有 Worker callback 上传;后续受控任务包改为验证器只输出受限 JSON 到 Nomad Allocation stdout,Runtime 使用现有 Nomad 受控 API 回收、再校验和持久化结果。
  • 2026-08-12,独立网页验证器 Nomad 任务包与 Runtime 回收路径已完成仓库实现:严格 url/checks 参数、不可变验证器镜像摘要、pcdell-103 专网约束、无内部回调或一次性令牌、Runtime 从 Allocation stdout 回收并二次校验/持久化。该实现待本批次提交、CI、103 最小 GHCR 拉取身份和真实 Nomad 验收;在所有条件完成前能力目录继续显示不可用。
  • 2026-08-12,只读生产 Nomad 核验确认 pcdell-103readyeligible、未 Drain 的 compute-general 节点,batch_allowed=true、Docker 健康且当前无 Allocation;因此验证器固定节点与标签约束正确。核验同时发现初版隔离验证器 HCL 把嵌套块压成单行,真实 nomad job validate 会拒绝该语法;已改为标准多行 HCL,并在生产 TLS/ACL 环境对运行时生成的 HCL 返回 Job validation successful。这只证明任务包可解析,未提交 Job、未拉取镜像,也不构成验证器生产启用。
  • 2026-08-12,HCL 修复经 PR #28 合并为 a41ac71。Runtime Actions 31565857803 与 Docs Actions 31565857801 均成功;Runtime sha-a41ac71 镜像摘要为 sha256:96cb60fdaab46b2f55518bf3b845aed674831047282e994a0f9f2bd69b4407b5,Docs sha-a41ac71 索引摘要为 sha256:03a0bd586b7eb5fc7d99d680b7258f9c711c3e7face48ad816724471d8f695a7。Docs 已切换该摘要:本机和公网 /healthz 均返回 ok,公网正文显示 P4“进行中”,且三个公开部署脚本与仓库 SHA-256 一致。Runtime 镜像尚未部署,P4 开关及 web-verifier/v1 可用状态均未改变。
  • 2026-08-11,批次 4 已完成仓库实现:P4 AI BOSS 审核使用严格结构化每标准结论;高风险和未知风险任务在审核后进入 benson_decision;Benson 通过、返工、拒绝和重开均校验任务当前状态。返工会创建保留 P4 契约的新任务、待产出替代成果和待检查标准,保留旧成果与证据;重开会把已完成下游标为“前置结果已变更”,未开始下游回到依赖阻塞,禁止错误释放。真实模型、真实 Worker 和生产场景仍未验收。
  • 2026-08-11,批次 5 已完成 Console 仓库实现:AI BOSS 工作台已固定为“对话、任务、成果与验收、记忆、系统操作”五个分区。成果中心按需读取成果和待决定列表,安全展示标准、检查、证据与 Benson 决定;仅在后端给出匹配状态时显示决策按钮,P4 读取功能关闭时明确降级且不影响既有对话和任务。桌面和移动浏览器契约已回归,生产 Console 尚未切换。
  • 2026-08-11,验证写接口幂等与恢复收口:POST /boss/v1/tasks/{task_id}/verify 接受兼容可选的 client_request_id;Runtime 对验证运行增加增量 client_request_id 列和任务/成果/验证器范围内的唯一索引。检查运行、可访问证据和验收标准状态在同一 SQLite 事务中写入;同一请求键在 Runtime 重启后只回放原运行与标准,不重复读取成果或生成证据。未提供请求键的旧调用继续保持兼容,但不宣称幂等。专用重启回归已覆盖重复请求不增加运行和证据。
  • 2026-08-11,幂等批次合并提交为 aafebb5(包含实现提交 39dda14)并完成远程构建:Runtime Actions 31493712847 成功,Runtime 镜像摘要为 sha256:3334ecf9100fe807cfe669527900a5febfadefb24abcef2fbb92db113a066db;Docs Actions 31493712882 成功,Docs 镜像摘要为 sha256:65d04794ddef4b840115b3f6f6b3d7aa7291a2ab9e1f8fddf3c58b8a06ceb576。镜像已构建但尚未切换生产。
  • 2026-08-11,Benson 验收写接口完成同样的兼容幂等收口:AcceptanceDecisionIn 接受可选 client_request_id;验收决定增加增量列和任务/成果范围唯一索引。重复请求在任务已完成、返工或重开后先回放原决定,不重复修改成果状态、写审计或创建返工任务;不同参数复用同一请求键会明确返回冲突。旧调用未提供请求键时保持兼容。
  • 2026-08-11,P4 最终验收状态机完成仓库收口:低风险任务的 AI BOSS 结构化审核不再直接把任务标记为 completed;Runtime 只有在成果已就绪、全部必需检查通过、标准绑定证据真实可访问、每条必需标准都有 boss.review/v1 通过记录后,才原子地把成果和标准设为 accepted、任务设为 completed 并释放下游。高风险 Benson 通过复用同一 finalizer,不能覆盖失败检查、缺失审核或伪造/跨成果证据;能力目录据此把自动验收改为“已支持,需智能规划与检查器同时启用”。
  • 2026-08-12,Console 成果中心完成仓库扩展:成果列表增加计划、任务、类型、状态、时间和 Benson 过滤;详情读取 Runtime 安全预览与安全访问接口,展示版本替代、回滚引用、检查、证据、AI BOSS 审核和 Benson 决定。任务页增加暂停、恢复和取消按钮;Runtime 尚无通用重试或重新规划接口时按钮保持禁用并显示真实原因。浏览器契约覆盖 1440×900 与 390×844、四种 Benson 决定、幂等键、安全 Cloudreve 入口、移动端无溢出和 P4 未启用降级。
  • 2026-08-12,补齐计划级生命周期仓库实现:POST /boss/v1/plans/{plan_id}/cancel 使用持久 client_request_id 幂等记录,原子停止未完成任务、通知主节点协作式取消、清理已提交 Nomad Job,并保留已完成成果、证据和审计;POST /boss/v1/plans/{plan_id}/replan 仅从已取消、失败或部分完成的计划创建不可变后继版本,记录 supersedes_plan_id。Console 任务区已提供与后端状态匹配的“取消计划 / 重新规划”入口。本地 Runtime 全量回归 106 passed、计划定向 27 passed 和 Console 浏览器契约均通过。实现提交 f80c88d 经 PR #30 合并为 c4b8f2c;同一分支提交 dc3ad2c 的手动远程构建均成功:Runtime Actions 31567496984 镜像摘要 sha256:8c76b0da027c98c481d3884ee501ef370f8c380dd0ebeb77dde68998fd8b7c8b、Console Actions 31567498304 摘要 sha256:7aecd939e1e4363e5a1367efb9e9774832a235991939f8b0a07b9435218eb525、Docs Actions 31567499740 摘要 sha256:9709724a4519048ca85ff70f5433a5971f3fb18eb518f0c827052d78c68836bc、验证器 Actions 31567501959 摘要 sha256:d6f54c9dc1c87123fed35166484a20a24815d5c7efe00f8ba6cecec6d9bfbf14。这些构建均不等于生产启用;Runtime 和 Console 尚未部署,P4 功能开关仍保持关闭。
  • 2026-08-12,Docs 证据页已随 PR #31 合并提交 6dc67ac 发布。Docs Actions 31567723416 成功,镜像摘要为 sha256:b624ce99dc5c8b292266247966b669927ca96f114e38545378eb6b9e8bd0ec6b;主节点已按受控部署脚本切换该摘要,旧 sha256:6daf9f03a9b29bb9c98a39ef9c8bea5aab35fcd6a61a84da491f2d60c8648d7e 保留为 rollback。本机 http://127.0.0.1:39130/healthz 和公网 https://docs.yohan.fun/healthz 均返回 ok,两侧 P4 正文均可检出“计划级生命周期”和 Actions 31567496984。部署仅回收 12.4 MiB 悬空 Docs 层,未清理运行容器、卷、latest/rollback、BuildKit 缓存或本地验证器镜像。
  • 2026-08-12,使用 Worker 103 正确的 Tailnet 管理入口 100.64.0.5:10322 完成只读复核:agentmeshos-web-verifier-egress.serviceactive,专属网络为 172.31.250.0/24/etc/agentmeshos/web-verifier-ghcr.env 和固定摘要的验证器镜像均不存在。因此能力目录继续显示不可用,但原因从已过期的“出口隔离未验证”修正为 worker_103_ghcr_pull_credentials_required。下一步需要由 Benson 创建或提供只含 read:packages 权限的专用 GHCR 拉取凭据,并以 root:root 0600 写入该文件;不得复用主节点宽权限 GitHub Token,也不得把凭据写入 Git、Runtime、Nomad HCL、容器环境、日志或浏览器。
  • 2026-08-13,重新只读复核 Worker 103:agentmeshos-web-verifier-egress.service=active、隔离子网仍为 172.31.250.0/24,但 /etc/agentmeshos/web-verifier-ghcr.env 与固定摘要验证器镜像仍不存在。主节点对 GHCR 固定 Manifest 的匿名最小请求返回 HTTP 401,并明确要求 repository:michaellab7284/agentmeshos-web-verifier:pull;这与 Worker 的凭据缺失相互印证。该阻塞不是 Runtime、模型、Nomad 或出口隔离故障,不能以公开镜像、主节点宽权限 Token 或放宽 Worker 网络绕过。继续真实网页验证前必须提供仅能读取该包的 GHCR read:packages 凭据,部署脚本将只在 Worker 103 root-only 文件中短暂用于 docker pull 后登出。
  • 2026-08-12,智能计划到隔离网页验证器的输入绑定已补齐:Benson 只能在 public 计划请求中显式提交已授权网页目标及声明式检查;Runtime 在模型调用前校验 URL、DNS 解析和 web-verifier/v1 参数。AI BOSS 规划上下文只看到目标 ID,不能看到或生成 URL/检查参数;它只能把 web-verifier/v1 任务绑定到已授权 ID。Runtime 落库时冻结真实 {url,checks} 到任务快照,重新规划从前计划的冻结快照恢复同一授权目标。该路径完成单元回归但能力仍不可用,必须等待 Worker 103 最小 GHCR 拉取凭据、固定镜像拉取和真实 Nomad 验收后才能灰度启用。
  • 2026-08-12,PR #34 已合并为主线 d4304f1。主线 Runtime Actions 31578702910 与 Docs Actions 31578702890 均成功。Runtime 已按正式部署脚本切换到 ghcr.io/michaellab7284/agentmeshos-ai-runtime:sha-d4304f1 并通过健康、私网拓扑、OmniRoute/Operation Bridge 连通、旧消息/任务/Artifact 可读和 SQLite quick_check=ok 验收;所有 P4 开关继续关闭,web-verifier/v1 仍因 Worker 103 专用 GHCR 凭据缺失而不可用。部署前备份为 /var/lib/agentmeshos/ai-runtime/backups/runtime-pre-p4-runtime-sha-d4304f1-20260812T083741Z.db,SHA-256 为 dc7ca74ecf32927ec459c639457733d310f3ec4448f77f89c964cc298582fab5。同批次发现并修正 Runtime SQLite 文件权限为 root:root 0600,修正提交为主线 531f4ba;这只改变数据保护,不开启任何 P4 功能。
  • 2026-08-12,只读灰度已完成:在 Runtime 保持 sha-d4304f1、P4 智能规划/验证器/自动执行/自动验收均关闭的前提下,仅开启 AI_RUNTIME_P4_READ_API_ENABLED=trueAI_RUNTIME_P4_DELIVERABLE_PREVIEW_ENABLED=true,并按正式脚本重建容器使环境变量真正生效。生产 GET /boss/v1/plans/boss/v1/deliverables/boss/v1/acceptance-inbox/boss/v1/capabilities 均返回 HTTP 200;健康、旧消息/任务/Artifact、SQLite quick_checkroot:root 0600 复核通过。只读灰度备份为 /var/lib/agentmeshos/ai-runtime/backups/runtime-pre-p4-read-gray-20260812T085229Z.db,SHA-256 为 ff685ceba86c06c0821d70646832c108ba8b474d5d9aed90d8477587b28fe993
  • 2026-08-12,智能规划预算契约修复与生产灰度完成:提交 3d0e308 在 Runtime 提示中明确当前预算档位的任务 Token 上限和任务总和约束,GitHub Runtime Actions 31582204642 成功,镜像摘要为 sha256:0ad957fdb373381c2ad658e07834ac875eeb8596e9b643a78072c040ab429d5e,生产容器健康。使用新幂等键的公开低风险目标请求返回 HTTP 201,一次模型调用生成两步结构化计划,计划状态为 ready,均衡档位快照包含 task_tokens=100000;首个 Nomad 任务保持 queued,依赖任务保持 blocked_dependency,自动执行开关仍为 false,没有新增 Nomad Job。SQLite quick_check=ok,数据库仍为 root:root 0600。这只完成“智能规划但不自动执行”的灰度出口,Worker 实际执行、成果检查、AI BOSS 审核、Benson 决策和 P4 最终归档仍未完成。
  • 2026-08-12,来源授权契约经提交 eb5f31c、Runtime Actions 31585859608 成功并部署为 sha-eb5f31c。公开研究任务必须绑定 Benson 授权的来源 ID;Runtime 校验并冻结 URL,模型上下文不包含 URL。生产计划 468e2657ad174312a4c208b425994890 真实执行:Nomad Job agentmeshos-runtime-daafa2022b4d42dfpcdell-101 的 Allocation c0595075 完成,Worker 从 https://example.com 读取 559 bytes 并回传 Artifact。AI BOSS 审核输出无法解析,Runtime 没有自动通过,而是把任务置为 rework_requested、生成返工任务并保持下游阻塞;随后关闭 AI_RUNTIME_P4_AUTO_EXECUTION_ENABLED,返工任务保持 queued。Runtime 健康、SQLite quick_check=ok、Nomad Job 已结束。该批次完成了真实派工、节点执行、Artifact 回传和审核失败保护,但暴露出结构化 AI 审核仍需修复,成果检查器和自动验收仍未完成。
  • 2026-08-12,审核契约收紧提交 b2180b5 已部署到生产 Runtime:每条必需验收标准的审核提示只给出对应证据 ID,要求唯一 JSON 对象、无额外字段、无 Markdown 或说明文字,并要求覆盖全部必需标准。解析失败、伪造证据 ID 或遗漏必需标准仍进入证据不足/返工,绝不绕过为通过。生产 Runtime 运行镜像为 sha-b2180b5,健康、SQLite quick_check=okAI_RUNTIME_P4_SMART_PLANNING_ENABLED=true,只读和安全预览均为 true,验证器与自动执行均为 false。这只是把审核输入输出契约部署到生产,尚未证明真实模型已稳定返回合格审核 JSON,更不构成自动验收启用。
  • 2026-08-12,Console 已切换至镜像摘要 sha256:98a18bb1946856bb4d8d6dfc24244acc8e5cb96d8165ee87a891c7c9109545c1 并通过容器健康与 1440×900、390×844 浏览器契约;移动端 Benson 决策区保持两列稳定布局,不遮挡正文或操作。公网未认证入口按预期跳转 A-Auth。发布脚本同时暴露维护清理器把短镜像 ID 与容器完整 sha256 ID 混比的缺陷;Docker 因运行容器引用而拒绝删除,未影响 Runtime。修复后清理器使用完整 ID 过滤运行镜像,真实 --dry-run 已不再列出运行 Runtime,且新增离线回归覆盖该场景。
  • 2026-08-12,补齐关闭自动执行时的受控返工入口:POST /boss/v1/tasks/{task_id}/dispatch-rework 只接受已排队、p4-v1 且有返工来源的任务;首次 Benson 请求在同一 SQLite 事务中持久化幂等键、领取任务和创建运行记录,同键重试回放同一运行,不能重复调用模型或提交 Nomad。Console 仅在后端安全任务视图标记 is_rework=true 时显示“执行返工”,普通任务、恢复任务和后台扫描均不能借此执行。任务图也改为 P4 白名单视图,浏览器不再取得完整任务规格或结果。该仓库实现已通过 Runtime 114 passed、Console 浏览器契约和计划状态检查,待提交、CI、生产灰度与真实结构化审核验收;它不是 AI_RUNTIME_P4_AUTO_EXECUTION_ENABLED 的替代,也不启用 P5。
  • 2026-08-12,受控返工入口完成生产灰度:Benson 显式派发计划 468e2657ad174312a4c208b425994890 的排队返工任务 cdf511a44b3340c9,同一幂等键立即重放且只持久化一条操作记录、一个 Nomad 运行。Job 在 pcdell-101 完成并回传 271 bytes JSON Artifact(SHA-256 d49f9c518d528439bfe5e11c41f463a07a53f9b866d5e1566ff39f6875ee71ff);OmniRoute 分析调用结算 3004 Token,AI BOSS 审核调用结算 4763 Token。审核文本仍不满足严格 JSON 契约,Runtime 因此把本任务保留为 rework_requested,创建下一轮返工任务并保持下游阻塞;验证器和自动执行均为 false,SQLite quick_check=ok。此轮证明显式派发、幂等、Nomad 执行、成果回传和“解析失败绝不自动通过”已在生产成立,同时明确稳定结构化审核和确定性检查仍是 P4 未完成出口。
  • 2026-08-12,本轮证据记录提交 e2c6d03 已推送主线;Docs 自动构建 31592905496 与人工复核构建 31593113383 均成功。主节点按正式 Docs 部署脚本切换至 sha256:2d2f62ea441073cdf4ebd16521fb9157bca96b2d8fb23ee60aa5892915fe690b,本机和公网 /healthz 均返回 ok,公网 plans/in-progress/ 已检出返工任务 ID 与“受控返工生产灰度已完成”正文。发布未修改 Runtime、验证器或 P5 开关;部署脚本仅回收 12.45 MiB 悬空镜像层。
  • 2026-08-12,审核格式修复提交 fd0ab6d 经 Runtime Actions 31593967181 和独立复核 31594040577 成功。Runtime 仅把单个完整 json 代码围栏规范化为原有 Pydantic 审核契约;前后附加文字、多个围栏、伪造证据和缺失确定性检查仍然失败。部署前 SQLite 备份为 runtime-pre-boss-review-json-fence-fd0ab6d-20260812T115612Z.db,SHA-256 690c99072e00c3920c97abe1b43ec40ecab1fae0f6e429f1e21e0479ee2c397b;正式部署首次在 Worker 预加载阶段出现瞬时镜像检查异常,Runtime 未被替换。只读复核确认 101、103 均已有预期非 root Worker 镜像且可运行,第二次正式部署复用两侧镜像后成功,Runtime 镜像 ID 为 sha256:c4294b884d8564c40c3dc1294f65ba51204684ae156a671f6e51776d967c811b,健康、私网拓扑、旧数据可读和 SQLite quick_check=ok 均通过。
  • 2026-08-12,部署后显式派发返工任务 ecd6247fcf474aa1 并以同一幂等键重放,只产生一个 Nomad 运行。Worker 回传 271 bytes JSON Artifact(SHA-256 b736434569a0338a1c7fc8e9882bb8150b62e4a6acb4289ed56e21efb04feafc);AI BOSS 审核输出已被识别为 json_fence,两条结论均按原契约写入 boss.review/v1,但均为 insufficient_evidence。因为验证器仍关闭,必需确定性检查未通过,任务最终为 failed,没有自动验收、没有下游释放、没有无限重试。此证明确认格式规范化生效且验收硬门槛保持有效;下一步是受控灰度确定性检查器,不是放宽模型审核。
  • 2026-08-12,Runtime 轻量确定性检查器已完成受控生产灰度。备份 runtime-pre-p4-verifiers-gray-20260812T120445Z.db 的 SHA-256 为 a5eee43bfedfd5131c4f7cdaf88b44e7bf799d2ac6c5f64ac36f7a5a9810ce06;生产容器实际加载 AI_RUNTIME_P4_VERIFIERS_ENABLED=true,而 AI_RUNTIME_P4_AUTO_EXECUTION_ENABLED=false 保持不变。对同一任务的 SQLite JSON 成果 3a34d2b2ef23411e8dfed3010545d19e 显式检查后,Runtime 回读 271 bytes 并通过大小、SHA-256、文件头、UTF-8 和 JSON 五项检查,写入检查运行 e84216c95a00400e836f674517bdbbce 和可访问 artifact_hash 证据 a944e08b8c964034a4fe10c1b3d99da6。同一幂等键重放返回同一运行;任务仍为 failed,没有模型调用、自动验收、下游释放或自动重试,SQLite quick_check=ok。该灰度只证明 Runtime 轻量检查器,不替代 AI BOSS 审核、Benson 决定、重型/网页检查器或 P4 最终出口。
  • 2026-08-12,P4 新增仅重新审核入口并完成真实修复闭环。29d9507retry-review 只允许已执行且全部必需确定性检查通过的失败任务,复用既有成果/证据,不重跑 Worker/Nomad,并用 SQLite 幂等记录保护重复请求。首次生产审核暴露旧状态机在最终验收后激活下游时的异常隔离缺陷;7e41d67 将后续激活限制为真正 queued 的 P4 任务,激活失败只记录后续任务事件,不能覆盖上游完成状态。Runtime CI 31596777806 成功,部署镜像摘要 sha256:38fe713924238585ac21297eb4df18ce416b186789921150c72bb6f0f9f228d2,部署前备份 SHA-256 aa1bbe20734dc4bde129c3ebf7d980215d0fd9bad59571699798ae1a254a73aa。第二次使用新幂等键重新审核 ecd6247fcf474aa1 成功进入 completed,新增两条 boss.review/v1=passed;同键重放为 replayed=true,任务运行数和 Nomad 执行数均没有增加,SQLite quick_check=ok。这是一个真实的“检查通过 → AI 审核通过 → 最终验收 → 幂等重放”闭环证据,不能替代网页/重型检查器、Benson 高风险决定、依赖下游完整验收或 P4 最终出口。
  • 2026-08-12,Console bbae71d 将该受控路径露出到任务工作台:“重新审核”只对失败的 p4-v1 任务可用,提交 Console 幂等键且明确不重跑 Worker/Nomad;Runtime 保留最终状态与证据资格校验。Console CI 31597996152 成功,生产摘要 sha256:c8e264aa28cd5b7c8972fde6e3af58ba35e78ee364bdd5bd93e416bf279e4c6b,管理员外的公网入口继续经 A-Auth 保护。浏览器契约验证桌面、390×844 移动端、按钮资格、请求路径与幂等键;此 UI 发布没有开启自动执行或 P5。
  • 2026-08-11,批次 3 至 5 的增量实现以 bcbb9a2 经 PR #14 合并为 7164084。Runtime、Console、Docs 三个主分支工作流均成功:Runtime Actions 31458419763 的镜像摘要为 sha256:17def1e75b100002ea10d810eebe5baefc6a1064c9a261a539619553ecba1182;Console Actions 31458419708 的镜像摘要为 sha256:2f6ed195c5dc0bc388ddecf2522899b45863fa5bc71c67c56a47500a03c28d54;Docs Actions 31458419743 的镜像摘要为 sha256:6395f2413c6efae349a1508b3a880b61230eb991192808c2c702d12b92983800。这些镜像尚未部署,P4 开关和生产行为未改变。
  • 2026-08-11,验证 Worker 的只读实现审计确认:现有通用 Nomad Worker 使用 network_mode = "host",不能承担 P4 的公开网页/浏览器验证;当前没有可复用的专用浏览器镜像或节点级受限出站网络。必须先获得“只允许 DNS 和公网 TCP 80/443、拒绝 localhost、私网、Tailnet、链路本地与云元数据”的节点级隔离配置及真实验证证据,才可创建或启用 web-verifier/v1。本机 ssh rr 的最小二次验证在配置的 22 端口上对回环和公网解析均被拒绝,故不把任何主机/Worker 网络状态写成已确认;需取得当前正确的系统管理入口后重新只读核验。

1.1 文档、执行与恢复顺序

实施顺序固定为:

完成本权威计划和相关架构文档
→ 提交并推送 GitHub
→ Docs 严格构建、镜像发布和公网正文验收
→ 以该文档提交创建完整执行目标
→ 分批实施代码、测试和生产发布
→ P4 最终验收与新归档
→ P5 恢复为规划中

文档批次推送后,执行目标必须保存本页所在的精确 Git 提交哈希,并使用以下目标口径:

以指定 Git 提交中的 P4 权威计划为唯一实施依据,完成 AI BOSS 智能规划、能力选择、任务分派、通用成果登记、确定性检查、AI BOSS 审核、默认自动验收、Benson 高风险决策、Console 成果中心、生产发布和最终归档。

任何中断、主智能体切换或子智能体协作都必须先读取本页及其固定提交,不得依赖聊天上下文重新推断范围。文档批次完成只能证明计划已发布,不能证明 Runtime、Worker、Console 或生产能力已经完成。

1.2 已确认并保留的阶段四基线

下列能力已经在原阶段四中实现并形成仓库、测试或生产证据,本阶段只做回归验证和兼容保护:

  • AI BOSS 异步发送、SSE 增量、断线恢复、取消、显式重试和 Runtime 重启中断处理。
  • Token 保守、均衡、宽松档位,调用前预留、真实 usage 结算、费用展示和每日硬上限。
  • 上下文裁剪、滚动摘要、长期记忆、来源追踪和数据分级。
  • 图片、文本、PDF 附件,剪贴板粘贴、拖放和已通过真实 Smoke 的多模态后端。
  • OmniRoute 默认模型通道,以及只接收 Runtime runtime_redacted 上下文的 CLI Agent Gateway 显式备用通道。
  • 固定 SystemOperationsAdapter、主节点 root Operation Bridge 和双层审计。
  • API Gateway 对状态、节点、Nomad、告警和探针的只读聚合边界。
  • Runtime SQLite、Cloudreve、Nomad、Console 和认证回源代理的现有生产入口。

原阶段四归档中的真实交互 ID、Token、测试数量、镜像和公网证据仍以原阶段四完成归档为准。本页不重复复制会随时间漂移的运行数据。

1.3 重新开启原因与当前缺口

后续代码审计确认原阶段四的“结构化规划”和“审核”没有达到系统最终控制闭环:

  • 当前意图规划仍以关键词判断为主。
  • 当前任务规划固定生成单个 candidate_analysis 任务。
  • 当前规划输出固定为 executable=false,没有形成可验证、可执行的智能计划。
  • AI BOSS 尚未真正选择逻辑 Worker 能力、主节点或 Nomad 执行建议、依赖、并行关系和成果契约。
  • Runtime 的现有自动审核虽然调用模型,但最终是否通过主要取决于字段和证据引用是否为空,模型审核结论没有真正参与最终决定。
  • Console 只展示 Artifact 数量和旧审核记录,不能查看完整成果、证据、检查、版本、访问入口或 Benson 决策。
  • 当前 completed 混合了 Worker 执行结束、审核通过和最终交付完成,不能证明成果已验收。
  • 缺少统一 Plan、Deliverable、Evidence、Verification 和 Acceptance Decision 权威状态。

因此 P4 重新开启。原有验收事实继续成立,但不再使用“P4 已全部完成”描述当前阶段。

1.4 WebDAV 权限确认与固定结论

2026-08-11 已使用现有专用系统 WebDAV 身份完成不写入、不删除的只读确认:

WebDAV 根目录:207
AgentMeshOS-临时:207
AgentMeshOS-长期:207
Project:404
无关目录:404

由此冻结以下边界:

  • 不创建 Cloudreve root 或 admin 凭据。
  • 继续使用现有专用系统 WebDAV 用户名和密码。
  • 文档中的 root-only 只表示凭据文件由主机 root:root 0600 保护,不表示 Cloudreve 账户拥有 root 权限。
  • Runtime 可以使用现有凭据操作 AgentMeshOS-临时AgentMeshOS-长期;长期成果不自动删除。
  • Console、Worker、模型、MCP Tool 和浏览器不得取得 WebDAV 凭据。
  • Project 是独立项目库,使用另一套独立凭据,不与 Runtime Artifact 混用。
  • 正式文件下载继续走 cloud.yohan.fun 用户数据面,主节点和 Console 不成为大文件下载代理。
  • 2026-08-13 补充冻结:节点只做控制与执行,所有业务文件而非仅用户文件均必须走 cloud.yohan.fun 公网 HTTPS 数据面。镜像、安装包、构建产物、测试夹具、附件、成果和归档禁止经 SSH、Tailnet、Nomad 节点间链路、主节点代理或 Worker 间复制传送;Worker 仅从登记的公开下载地址取得任务输入,使用任务临时目录并在完成后删除。最大 1 MiB 的无文件化 JSON 回调直接写入 Runtime SQLite,是唯一例外。

批次 0 已依据生产接口、Cloudreve 实际对象和回读证据,把架构文档与 P3 专题中的现行存储口径统一为“受限 WebDAV 长期 Runtime Artifact 已启用”;后续代码、计划和部署记录不得恢复“暂停”这一过期结论。

1.5 已确认产品决定

  • P4 重新开启,P5、P6、P7、P8 编号不变。
  • P5 等待 P4 最终收口,不提前实施定时唤醒、事件触发或全局主动循环。
  • 普通低风险任务在全部必需检查和 AI BOSS 审核通过后默认自动完成,不增加普通任务审批。
  • 破坏性、外部业务动作、未知风险、检查器不支持或证据不足必须进入 Benson 决策。
  • Benson 决策是高风险动作或最终验收边界,不是批准单、准入报告或任务启动门禁。
  • 使用可扩展通用成果框架,首批为常见成果提供真实检查器。
  • 无法自动检查的成果转 Benson 人工验收,禁止假通过。
  • 不要求穷尽未来所有成果类型,但任何成果都必须能够登记、展示、追踪和人工验收。
  • 已验收长期成果不自动删除;返工和新版本通过版本关系保留历史。
  • 旧任务只做兼容映射,不伪造新的 Benson 验收记录。
  • AI BOSS 的会话、长期记忆、计划、任务、成果、证据、Benson 决定、版本和删除记录以 Runtime SQLite 为唯一权威;切换 OmniRoute、Codex、Claude 或未来已登记模型只改变推理能力,不能改变同一会话的身份、记忆归属或连续性。
  • OmniRoute Memory、Context Sources 和 Compression 是 OmniRoute 自身可独立评估的产品能力,不作永久关闭结论。2026-08-13 只读审计确认其 Memory 默认关闭且当前没有条目;自动检索按 API Key 隔离、但不是按 sessionId 隔离,因此共享 Runtime API Key 下的不同 AI BOSS 会话会有串记忆风险。官方 3.8.49 已支持 x-omniroute-no-memory: true:该请求级开关会同时跳过 Memory/Skills 注入和成功后的自动事实抽取写入。AI BOSS 不把 OmniRoute Memory 作为正式记忆管理链路,并且必须在每个 OmniRoute 调用显式发送该 Header;OmniRoute 自身用途可在独立专用 Key、隔离范围、短保留期和跨 Key 不可检索/不写入 AI BOSS 的真实验收后启用,仍不能替代跨模型 Runtime 记忆。
  • 2026-08-13 上游版本复核:生产 omniroute@3.8.49 仍是 npm latest 与 GitHub 最新正式 Release。上游 release/v3.8.50 分支虽已含额外 Memory 改进(例如自定义远程 embedding endpoint),但 npm 不存在 3.8.50 包,GitHub 也无对应 Release;禁止把未发布分支直接替换生产服务。仅当 npm 与正式 Release 同时发布可追溯新版本后,才按“备份原始数据、迁移差异、隔离启动、普通模型/Memory Header/回滚验证”流程升级。
  • “公开/私有”不得被定义为模型记忆是否连续的人工开关。Runtime 统一保留完整会话;2026-08-13 起,Console 移除该选择,Runtime 在每次模型外发前替换可识别的凭据、连接字符串、内部端点和主机路径并标记为 runtime_redacted。原始会话不删除,模型切换不造成断片;基础自动脱敏不能覆盖无法可靠识别的敏感材料,图片仍须经过独立能力 Smoke。
  • 统一上下文与记忆是 AI BOSS 的前置能力:先完成 Runtime 统一上下文、记忆工作台、模型切换连续性和 OmniRoute 独立 Memory 验证,再继续智能编排、成果、检查、审核与 Benson 决策主线。不得以“以后收口”为由让不完整记忆参与后续 AI BOSS 业务判断。

1.6 当前 TODO:模型通道管理收口

模型通道是“通过验证的单模型能力”,不是按 BOSS、Worker 或对话可切换性分别授权的清单。为消除编辑页与列表控制的重复语义,P4 在本轮收口中执行以下规则:

  • 动态单模型通道只有在真实 Smoke 成功后才可保存;一经保存即固定同时具备 AI BOSS 与 AI Worker 资格,且固定允许在对话中选择。新增或编辑表单和对应写接口不得再暴露“AI BOSS”“AI Worker”或“允许在对话中切换”勾选项。
  • 既有数据库中的角色及可切换字段保留为增量兼容,不做破坏性迁移;Runtime/Gateway 读取历史记录时必须统一投影为 boss + worker 与“对话可选”,不得让历史单角色记录造成能力差异。
  • “当前 BOSS、当前 Worker、当前 Codex、当前 Claude”是列表层的四项独立选择,不是通道资格。列表必须用明确的表头和按钮状态显示,可设为当前、切换或取消当前;BOSS/Worker 的选择不隐式改写 Codex/Claude 当前通道,Codex 与 Claude 也彼此独立。
  • Console 创建或更改上游身份时,必须输入独立服务 URL/API Key,读取模型目录或手填单模型并完成与 provider/client/protocol/base_url/api_key/model 绑定的真实 Smoke;验证结果应短时、一次性且不可跨配置复用。Codex CLI 固定 Responses API、Claude CLI 固定 Anthropic Messages;独立 Codex Direct API 执行器可选择 Responses API 或 Chat Completions,二者以不同固定请求/响应契约真实 Smoke。API Key 只由 Gateway 加密保存,不回显、不进入 Runtime、日志、Git 或模型上下文。
  • 未配置成功的静态 anbalu-codex-gpt-5.6-terra 候选已删除。只有用户在 Console 填入真实上游 URL/Key 并通过 Smoke 的外部 Anbalu 或其他通道,才可以称为可用或被设为当前;在此之前,不能以候选、目录项或架构文字冒充可用能力。
  • 收口验收依次覆盖 Gateway 写契约、Runtime 投影、Console 桌面与 390 × 844 移动表单/列表、保存前 Smoke 拒绝、编辑上游配置后强制复验、旧记录兼容和生产发布。发布顺序保持 CLI Gateway → Runtime → Console → Docs;P4 状态在全部真实验收前继续为“进行中”。
  • 通道数量、同一通道并发数和人工队列不是 P4 的预设限制。每次 CLI 调用继续使用独立运行 ID、临时 HOME、输入文件与取消范围;同一 Codex 或 Claude 通道可以按上游实际能力正常并发。只有出现真实的上游限流、会话串扰、临时目录冲突、资源耗尽或取消相互影响时,才基于可复现证据修复,不能预先把推测性配额写成产品规则。
  • 所有 enabled && available 的已登记通道都必须出现在 AI BOSS 对话下拉框并可直接选择;“当前 BOSS / Worker / Codex / Claude”只决定未显式选择时的默认线路,不能把其他已启用通道藏起来。
  • 文本 Smoke 与图片资格分开记录。文本 Smoke 通过只证明最小文本调用可用;图片上传、粘贴和图片随对话发送必须经同一通道的真实图片 Smoke 验收后开放。未通过时显示真实原因,不丢弃文字、PDF 或可提取附件内容。

二、架构、职责与技术选择

2.1 最终控制链

flowchart LR
    Benson["Benson / Console"] --> Boss["AI BOSS:理解目标、规划、派工、审核、汇总"]
    Boss --> Contract["结构化计划契约"]
    Contract --> Runtime["Runtime:能力、安全、预算、状态和幂等校验"]
    Runtime --> Graph["SQLite 持久任务图"]
    Graph --> Main["主节点受控 Adapter"]
    Graph --> Nomad["Nomad 调度"]
    Nomad --> Workers["101 / 103 无状态 Worker"]
    Main --> Deliverables["成果与证据"]
    Workers --> Deliverables
    Deliverables --> Verifiers["确定性检查器"]
    Verifiers --> Review["AI BOSS 语义审核"]
    Review --> Auto["普通任务自动验收"]
    Review --> BensonGate["高风险 / 外部动作 / 证据不足"]
    Auto --> Complete["任务最终完成"]
    BensonGate --> Complete

AI BOSS 是语义总控,但不是无限权限控制器。它负责理解、拆分、选择逻辑能力、安排依赖和审核语义;Runtime 负责确定性校验与状态执行;Nomad 只负责具体节点放置。模型建议不得绕过 Runtime 的能力、安全、预算和风险硬边界。

2.2 AI BOSS 职责

AI BOSS 负责:

  • 理解 Benson 的真实目标和完成标准。
  • 判断请求属于普通问答、需要澄清、任务规划、工具调用、固定系统动作还是拒绝。
  • 把复杂目标拆为可执行任务。
  • 从 Runtime 提供的脱敏能力目录中选择已登记的逻辑 Worker 能力。
  • 提议任务留在主节点受控 Adapter,或交由 Nomad 已登记任务包执行。
  • 决定依赖、并行关系、预期成果、验收标准、数据等级、预算建议和最大返工轮次。
  • 监控计划与任务状态,审核成果及真实证据。
  • 提出返工、重新规划、限制说明和最终汇总。

AI BOSS 不直接选择 101 或 103 等具体物理节点,不持有基础设施凭据,不把自然语言变成命令,也不能降低 Runtime 判定的风险等级。

2.3 Runtime 职责

Runtime 负责:

  • 使用 Pydantic 验证 AI BOSS 计划契约。
  • 验证能力、任务包、检查器、数据等级、风险、预算、资源和执行方式是否真实存在且当前可用。
  • 持久化计划、任务图、成果、证据、检查、审核和人工决定。
  • 冻结能力、预算、策略和数据等级快照。
  • 调用固定 Adapter,执行幂等、状态迁移、重启恢复、硬上限和追加式审计。
  • 对非法或不可用计划返回明确、结构化的原因。

Runtime 不代替 AI BOSS 进行业务语义派工,不用免费模型或规则重新决定“做什么工作”。规则负责验证是否允许和是否可执行;AI BOSS 负责提出业务计划。

2.4 Nomad 与 Worker 职责

Nomad 负责:

  • 接收 Runtime 已验证且已登记的任务包。
  • 按现有单用户系统规则,根据节点角色、CPU、内存、磁盘和 batch_allowed 选择具体可用节点并立即调度。
  • 管理 Job、Allocation 和 Evaluation。

Nomad 不理解自然语言目标、不选择业务 Worker、不审核成果,也不调用模型。

Worker 负责:

  • 执行已登记、版本化、无基础设施凭据的任务包。
  • 返回符合输出契约的结构化结果、成果引用和证据。
  • 保持无状态、可替换,不自行扩展目标、权限、预算或检查范围。

Worker 不得直接取得主机目录、Cloudreve、Provider、SSH、Docker Socket 或 Nomad Token,也不得接收任意 Shell。

2.5 API Gateway 与模型通道边界

  • AI BOSS 的聊天、计划、任务、成果、验收和系统动作继续由 Console 经主节点认证回源代理直达 Runtime。
  • API Gateway 继续只为 Console/Status 聚合状态、节点、Nomad、服务、告警和探针;只接收 Runtime 的 HMAC 脱敏故障摘要。
  • API Gateway 不新增任务、成果或模型接口,不成为第二控制面。
  • OmniRoute 继续是通用 Provider、模型、路由、健康、额度和调用日志权威;AgentMeshOS 不修改其官方源码或维护私有 Fork。
  • CLI Agent Gateway 只作为 AI BOSS 显式选择的固定备用推理通道,按后端目录声明允许数据范围和推理强度,不成为第二 Provider Router。

2.6 技术选型

方案 可维护性 部署复杂度 性能 团队学习成本 后续扩展 决定
FastAPI + SQLite + SSE + Pydantic 延续现有 Runtime 与状态模型 满足单用户和有限并发 最低 可继续扩展计划与成果模块 采用
Celery + Redis 增加队列和第二状态源 中高 当前收益有限 适合未来高并发 不采用
Temporal 等工作流引擎 工作流能力完整 当前规模过重 长期扩展强 暂不采用
Vanilla JavaScript Console 延续现有页面与发布链 无额外前端运行时 当前规模足够 采用
React/Vue 重写 组件化更强 中高 当前收益不足 后续可复评 不采用
API Gateway 统一执行 形成第二控制面 增加调用链 权限风险大 禁止
Runtime 内置全部重型检查依赖 单镜像膨胀,隔离较差 影响 Runtime 启动和资源 扩展成本高 不采用
Runtime 轻量检查 + Nomad 验证 Worker 职责清晰,检查器可版本化 重型检查隔离 低至中 易增加受控检查器 采用

继续使用 FastAPI、SQLite/FTS5、SSE、Pydantic、Vanilla JavaScript、Cloudreve/WebDAV、Nomad、Docker Worker、OmniRoute、CLI Agent Gateway 和固定 System Operations Adapter。不引入 WebSocket、Redis、Celery、Temporal、新向量数据库、新统一执行网关、任意 Shell 或第二套 Provider Router。

2.7 分布式底座接入声明

  • 接入结论:接入现有底座,不新增第二调度器、消息队列或执行网关。
  • Network:只承载认证回源、Runtime、Nomad、Worker 和受控服务通信;Cloudreve 用户文件仍走公网数据面。
  • Nomad:只运行 Runtime 已验证、已登记的业务任务包和验证 Worker。
  • Compute:主节点运行 Runtime 与轻量检查器;101/103 承担无状态任务和重型、无凭据验证。
  • Storage:计划、任务、成果元数据、证据和决定进入 Runtime SQLite;正式文件进入 Cloudreve 专属临时或长期目录。
  • Observability:使用 Runtime 事件、Token、审计、Nomad 事实和 API Gateway 脱敏告警。
  • Adapter:复用 NomadAdapter、StorageAdapter、ToolAdapter、FeedbackAdapter、OmniRouteAdapter、CliAgentGatewayAdapter 和 SystemOperationsAdapter;检查器通过显式目录接入。
  • 凭据:只留在主节点 root-only 配置;Worker、模型、MCP Tool、浏览器和 API Gateway 不可见。
  • 生命周期:计划、任务和长期成果不设置人为 TTL;只清理有明确引用范围的临时文件和一次性凭据。

三、智能编排实施规格

3.1 持久 Plan

新增 boss_plans,每个 Plan 至少保存:

  • plan_id
  • client_request_id
  • conversation_id
  • interaction_id
  • goal
  • intent
  • status
  • risk_level
  • data_classification
  • budget_profile
  • budget_snapshot
  • capability_snapshot
  • planner_runtime_call_id
  • planner_provider
  • planner_model
  • plan_version
  • supersedes_plan_id
  • limitations
  • created_at
  • updated_at

Plan 状态固定为:

draft
clarification
validating
ready
executing
verifying
benson_decision
completed
partial
failed
cancelled
superseded

completed 只表示 Plan 的全部必需成果已最终验收;任务代码运行结束或 Worker 回调成功不能直接写为 completed

3.2 结构化规划契约

AI BOSS 的规划输出必须是严格 JSON,并至少包含:

  • intent
  • goal
  • summary
  • assumptions
  • clarification_questions
  • tasks
  • dependencies
  • expected_deliverables
  • acceptance_criteria
  • risk_tags
  • limitations

每个任务包含临时步骤 ID、标题、目标、逻辑 Worker 能力 ID、执行方式建议、输入引用、依赖步骤、预期成果、验收标准、资源建议、Token 预算、数据等级、风险标签和返工状态。

计划不预设任务数量、依赖边、依赖深度或并行数量上限。Runtime 只校验结构是否合法、依赖无环、能力真实存在、资源请求可被目标执行面接受并如实返回 Provider、Nomad 或节点的实际拒绝结果;不得用推测性平台配额提前裁剪 AI BOSS 的计划。

模型文本、说明或 Markdown 不能直接成为命令、HCL、主机路径或任意 Adapter 参数。

3.3 规划模型调用

  • 默认使用现有 OmniRoute Boss Combo。
  • 2026-08-13 起,普通 AI BOSS 对话不再硬编码 CLI 默认模型。Runtime 会话、摘要和确认记忆保持唯一权威;未设置 BOSS 默认时使用系统托管 OmniRoute,设置了已通过 Smoke 且启用的 BOSS 通道后才使用该通道。创建 P4 计划时,Runtime 读取并冻结当时已验证可用的 BOSS 默认通道和 Worker 默认通道,记录实际 Provider、模型和通道 ID;BOSS 逻辑任务与 AI BOSS 审核使用冻结的 BOSS 通道,其他逻辑 Worker 任务使用冻结的 Worker 通道。同一计划的后续重试不会因页面设置变化而悄然换路;旧 Plan 缺少该字段时保持原 OmniRoute 快照语义。
  • 新增“模型通道管理”:一个外部通道固定对应一个 provider + 执行器 + protocol + model,并固定同时供 BOSS 与 Worker 使用、固定可在对话中选择;资格不是编辑项。Console 通过认证回源代理把 URL、Key、协议和模型提交给 Gateway;Key 只在 Gateway 持久卷内以 Fernet 加密 SQLite 保存,Runtime SQLite、浏览器、日志、审计和 Git 只看到 key_configured。模型目录按用户填写的原始 Base URL 请求 /models,不得擅自追加 /v1;读取失败允许手填模型,目录本身不能替代真实 Smoke。Codex CLI Smoke 启动隔离 CLI,Direct API Smoke 发送固定协议 JSON;两者均发送最小真实对话并验证预期回复,CLI 另校验退出码和结构化结果;未选定模型或未通过 Smoke 不能保存。当前协议固定为 OmniRoute Chat Completions、Codex CLI Responses API、Claude Code CLI Anthropic Messages;Codex Direct API 已作为独立执行器提供 Responses APIChat Completions 选择,不伪装成 Codex CLI 的可切换协议。实际全局默认、当前 BOSS、当前 Worker、当前 Codex 与当前 Claude 通道都只在列表状态按钮中选择;全局默认持久化,BOSS 未显式覆盖时继承它,选中 CLI 全局默认时同步该 CLI 当前通道。
  • 新通道、或 URL/Key/provider/model 的变更,都强制撤销旧 Smoke 并停用通道;只有 Benson 手动触发一次固定 Reply exactly: OK Smoke 成功,且验证令牌仍匹配当前配置时才可保存,保存后自动启用。没有自动重试、自动 Smoke、自动保存或自动回退。OmniRoute 是系统托管通道,仍不在此页面填写 URL 或 Key。
  • 2026-08-13 补充执行通道规则:CLI 子进程始终是短生命周期进程,完成即退出;Codex 与 Claude 可按上游实际能力并行运行多个进程,不设置通道数量、同一通道独占或预设并发配额。每次调用只需保持独立临时 HOME、运行 ID、输入文件和取消范围。这里的“当前 Codex 通道”和“当前 Claude 通道”不是进程锁,也不限制显式选择的对话通道;它们只是两项独立、持久化的默认选择。OmniRoute、当前 Codex 通道、当前 Claude 通道和 BOSS/Worker 当前使用标记均在同一目录显示。
  • 温度固定为 0。
  • Prompt 只包含系统约束、用户目标和脱敏能力目录。
  • 不把凭据、主机路径、Tailnet IP、Job HCL、完整基础设施配置或隐藏思维链送入或保存为规划事实。
  • 第一次严格 JSON 解析失败时允许一次修复调用;修复调用计入规划次数和 Token 预算。
  • 第二次解析失败后 Plan 进入 failedclarification,不执行任何部分解析结果。
  • 保存可展示的简短选择说明、假设和限制,不保存隐藏思维链。

3.4 能力目录

每项能力登记:

  • capability_id 和版本。
  • 角色与说明。
  • 支持的数据等级。
  • 支持的执行方式。
  • 对应任务包。
  • 输入与输出契约。
  • 可产生成果类型。
  • 默认资源与资源上限。
  • 可用状态和不可用原因。
  • 支持的检查器。

首批规范化能力:

  • boss.reasoning/v1
  • source-research/v1
  • candidate-analysis/v1
  • OmniRoute 六个现行只读工具。
  • 固定系统动作目录。
  • 节点管理固定动作。
  • 成果检查器能力。

代码开发、APP 构建、任意浏览器业务操作等未登记能力必须在能力目录中显示为不可用或不存在,不得由模型自述冒充可用能力。

3.5 Runtime 计划验证

Runtime 必须检查:

  • Pydantic 契约是否合法。
  • 任务 ID 是否重复。
  • 依赖图是否成环或超出深度、边数和任务数上限。
  • 能力是否存在且可用。
  • Worker 是否支持指定数据等级。
  • 执行方式是否在能力允许范围。
  • Nomad 任务包是否已登记。
  • CPU、内存、磁盘和超时是否在固定上下限。
  • URL 和数据来源是否符合安全规则。
  • 所有任务预算总和是否超过 Plan 硬上限。
  • 风险等级是否必须进入 Benson 决策。
  • 每个预期成果是否至少具有一条可判断的验收标准。

Runtime 不得静默替换 AI BOSS 选择的能力或执行方式。能力不存在、不可用或执行方式不匹配时必须返回具体错误,最多允许 AI BOSS 重新规划一次;重新规划仍不合法时,Plan 以能力不足、需要澄清或失败结束。

3.6 主节点、Nomad、并行与依赖

  • AI BOSS 选择逻辑能力,并建议主节点受控 Adapter 或 Nomad 任务包。
  • Runtime 只验证、冻结快照并提交已登记任务。
  • Nomad 只按节点标签、资源和 batch_allowed 选择具体节点。
  • 没有依赖且通过验证的任务可以同时入队,但不能超过冻结并行上限。
  • 前置任务只有最终 completed 后才释放依赖任务;仅执行结束、成果待登记或审核未完成都不能释放。
  • 节点不足时任务保持排队,并显示真实原因。
  • 任务包不存在或能力不可用时不提交 Nomad。
  • Runtime 重启后从 SQLite 持久状态确定性重建待提交 Envelope。
  • 运行中的模型调用在重启后标记 interrupted,不得自动重放。

3.7 生命周期控制

P4 提供任务级:

  • 暂停。
  • 恢复。
  • 取消。
  • 显式重试。
  • 要求返工。
  • 重新打开。
  • 重新规划。

控制规则:

  • 主节点任务必须实现协作式取消。
  • Nomad 任务取消时清理对应的已登记 Job。
  • 暂停不删除成果、证据或历史。
  • 恢复不能自动重放不确定的模型调用。
  • 中断模型调用只能通过显式重试生成新 runtime_call_id 和新预算预留。
  • 取消 Plan 时取消未开始任务,并向运行中任务发送取消请求;已经完成的成果继续保留。
  • P5 的全局暂停、策略暂停、定时触发和终止未来主动运行不在 P4 实施。
  • 当全局自动执行关闭、或任务不符合确认后自动派发资格时,Benson 可以在 Console 对单个排队中的初始 P4 任务明确点击“执行任务”;该请求必须以独立幂等键原子领取单次运行,不能派发返工任务、阻塞依赖任务或任何非 P4 任务。此受控入口不等同于 P5 主动循环。
  • 验收决定的首次写入响应与同一幂等键重放响应必须返回相同的安全证据 ID 列表;不得因首次写入还保留数据库 JSON 列而使 Console 缺失证据回显。
  • 生产验收中,模型返回上游错误文本、澄清请求或未完成工具片段时,Runtime 必须把它作为不合格成果进入返工或失败,不得以完整性检查通过代替语义验收;超过冻结返工上限后停止,保留成果、证据与审核记录,不再自动派发。
  • 每次验证记录必须同时保留受控回读来源和实际内容检查器 ID;例如 JSON 的回读来源可为 runtime.artifact-integrity/v1,内容检查器必须标为 json.schema/v1,不得以笼统名称掩盖实际检查范围。
  • Console 的成果详情必须同时显示上述两项,以 runtime.artifact-integrity/v1 -> json.schema/v1 的形式区分“谁在受控回读”和“实际检查了什么内容”;字段缺失时只显示已知来源,不得臆造检查器。该展示只消费 Runtime 已认证响应,不扩展浏览器权限或改变验收决定。
  • 2026-08-12,Console 展示实现由 c266f90 落地并发布:CI 为 Console 31601578753、Docs 31601578720,生产 Console index 摘要为 sha256:fcf24219dcc633a7633f2da8bc4eb897cb597e17f3aec5b615afb0617e8b1b1f,生产 Docs index 摘要为 sha256:24023e615700df15c0b66eb666827be68a098f4d7e393337459c8d082694c939。完整发布验收确认 GHCR、主节点运行容器、本机回源和公网入口摘要一致;Docs 公网正文可检出本条规则,Console 公网入口仍由 A-Auth 保护。该发布不重启 Runtime,也不改变任何 P4/P5 功能开关。
  • 2026-08-12,生产计划 bdfe38fe8c714d49ad1aa9af1a73baeb 完成真实依赖释放验收。私有低风险主节点前置任务 b6f378e40a57496e 先经过执行、受控回读和 JSON 检查,再进入 AI BOSS 审核;后置 3bf938aaaf094177 在所有这些中间状态一直保持 blocked_dependency,只有前置最终 completed 后才原子转为 queued。自动执行关闭时它没有被后台启动,而由 Benson 显式派发。后置两次版本的确定性检查虽通过,但 AI BOSS 审核均为 insufficient_evidence;Runtime 创建受控返工但没有自动派发。验收计划随后由 Benson 显式取消,保留前置 accepted 成果 e95559ecda8b438e8455ae2a18b528b6、其可访问证据 cf70b1b531bc44dc8908caa234906a0c 和后置成果版本链,未出现 Nomad、系统操作或外部副作用。此项证明“最终验收才释放依赖”和失败隔离,不把模型语义失败写成通过。

四、成果、证据与验收模型

4.1 增量表和兼容字段

增量新增:

  • boss_plans
  • acceptance_criteria
  • deliverables
  • evidence_records
  • verification_runs
  • acceptance_decisions

现有任务增量增加:

  • plan_id
  • plan_step_id
  • acceptance_policy_version
  • risk_level
  • result_contract_version

所有迁移保持向后兼容。旧消息、任务、审核、Artifact、记忆和附件继续可读;运行中旧任务保持原策略快照。

4.2 成果类型

成果类型使用可扩展注册 ID,不使用不可扩展的 SQL 枚举。首批内置:

  • knowledge.answer
  • document
  • file
  • media
  • code.change
  • software.package
  • container.image
  • web.deployment
  • api.deployment
  • data.output
  • model.output
  • database.change
  • system.change
  • external.action
  • continuous.observation
  • other

未知成果可以登记为 other,但不能自动验收,必须进入 Benson 决策。

4.3 Deliverable 字段与状态

每份成果至少记录:

  • deliverable_idtask_idplan_id
  • 名称、摘要、成果类型和数据等级。
  • 版本、来源角色和来源运行。
  • 位置类型和安全位置引用。
  • MIME、大小和 SHA-256。
  • Git 提交、镜像摘要或外部业务回执。
  • 预览方式和正式访问方式。
  • 限制、风险和回滚引用。
  • 被替代成果 ID。
  • 创建时间和更新时间。

位置类型:

inline
runtime_sqlite
cloudreve
url
git
image_digest
database_ref
operation_ref
external_receipt

成果状态:

draft
ready
verifying
accepted
rejected
superseded
rolled_back
legacy_recorded

长期成果一旦验收不自动删除。返工生成新版本并通过 superseded 关系保留旧版本和历史证据。

4.4 验收标准

每条标准记录标准 ID、所属任务或成果、标题、可判断描述、必需或可选、检查方式、检查器 ID、预期值、当前状态、对应证据、最近检查时间和决定人。

检查方式:

deterministic
boss_review
benson
mixed

禁止使用“质量好”“基本完成”等无法判断的空泛标准。AI BOSS 必须把标准改写为可验证条件,无法改写时提出澄清。

4.5 证据

首批证据类型包括:

  • 文件哈希与 Cloudreve 回读。
  • HTTP 响应、DNS/TLS 检查和浏览器截图。
  • 测试日志和 CI 运行。
  • Git 提交和镜像摘要。
  • Nomad Allocation 和 Operation Bridge 审计。
  • 数据统计、外部业务回执和 Benson 说明。

每条证据保存来源、对应成果、对应验收标准、内容摘要、安全引用、SHA-256、创建时间、检查器运行 ID、可访问状态和数据等级。证据引用必须在验证时真实访问或读取成功;只有字符串、文件名、URL 或模型自述不能算通过。

五、检查器与审核引擎

5.1 检查器目录

每个检查器统一登记检查器 ID、版本、支持成果类型、执行位置、数据等级、输入契约、输出契约、超时、最大输入、是否需要 Nomad、当前可用状态和不可用原因。

检查器结果必须结构化保存到 verification_runs,并关联具体成果、验收标准、输入哈希、检查器版本、开始/结束时间、状态、摘要和证据 ID。检查器进程成功退出不等于标准通过。

software.package 的首批真实检查只覆盖可受控回读的包哈希、大小、APK/ZIP 结构、AndroidManifest.xml 与 ZIP 可见的签名元数据条目;不验证签名密码学有效性、设备兼容性或可安装性。缺失任一已声明字段必须如实失败或转人工,不得把元数据存在写成“已签名可安装”。

5.2 Runtime 轻量检查器

首批实施:

  • Artifact 大小、SHA-256 和真实 MIME。
  • Cloudreve 回读一致性。
  • JSON Schema。
  • CSV 解析、行数、空值和重复。
  • TXT/Markdown 编码和长度。
  • PDF 文件头、页数和提取字符。
  • 图片格式、像素和解码。
  • ZIP/APK 基础结构和压缩炸弹限制。
  • Git、镜像和 Operation 引用格式。
  • Runtime、Nomad 和 Bridge 审计关联。

5.3 Nomad 验证 Worker

新增独立、版本化、无凭据的验证 Worker 镜像,用于:

  • 公开网站浏览器检查。
  • DNS、TLS 和 HTTP 链路。
  • 声明式页面元素和流程。
  • 截图和结构化结果。
  • CPU 较重且不需要 Cloudreve 凭据的文件分析。

验证 Worker 禁止接收任意 Shell、本地路径、动态代码或动态依赖;禁止访问私网、localhost、Tailnet、云元数据;禁止取得 Cloudreve、Provider、Nomad、SSH 或 Docker 凭据;禁止自行扩大检查范围。

5.4 常见成果检查矩阵

成果 自动检查 不能自动检查时
回答、方案、报告 引用访问、结论支持、冲突、重复、时效 Benson 查看
文件、PDF、图片 文件头、MIME、大小、哈希、回读、可预览性 证据不足
JSON、CSV、数据集 解析、Schema、行数、空值、重复和约束 专用检查或 Benson
网站、API DNS、TLS、HTTP、健康、版本、浏览器流程 私有登录目标转人工
代码、Git 提交存在、CI 状态、测试证据和变更摘要 私有仓库不可访问时转人工
APP、安装包 包名、版本、平台、哈希、签名存在和构建证据 无登记测试设备时不得声称可安装
容器镜像 摘要、标签、构建来源和健康证据 转人工
部署和系统变更 前后状态、健康、版本、审计和回滚 失败则返工或回滚
数据库变更 迁移记录、Schema、备份和前后检查 高风险时 Benson
外部业务动作 外部回执、业务 ID、时间和结果 必须 Benson
持续任务 当前观察窗口、最近运行和失败记录 不冒充永久正常
未知成果 来源和基础完整性 必须人工

自动检查只证明其覆盖的确定性事实,不能把“签名字段存在”写成“签名有效”,也不能把“构建成功”写成“已经在未登记设备上安装可用”。

5.5 安全限制

URL 检查必须拒绝:

  • localhost 和链路本地地址。
  • RFC1918 私网和 Tailnet 地址。
  • 云元数据地址。
  • file:// 与非 HTTP 协议。
  • 重定向到私网。
  • DNS 重绑定。

文件检查必须限制单文件大小、压缩层数、解压总大小、文件数量、图片像素、PDF 页数、解析字符数、解析时间、宏和可执行内容。任何超限、无法解析或安全结果不确定都必须失败或转人工,不能降级为自动通过。

5.6 AI BOSS 结构化审核

审核输出只允许:

accept
rework
insufficient_evidence

每条审核结论必须包含验收标准 ID、证据 ID、判断、简短依据、限制和返工指令。规则如下:

  • 模型审核结果必须真正参与最终决定。
  • 模型调用成功本身不等于审核通过。
  • 必需确定性检查失败时,AI BOSS 不能覆盖为通过。
  • 模型引用不存在、不可访问或数据等级不匹配的证据 ID 时,整条审核无效。
  • 模型审核失败、超时或无法解析时,任务进入证据不足,不自动完成。
  • 不保存隐藏思维链,只保存结构化判断和简短可展示依据。
  • 每轮只允许一次审核调用。
  • 返工最多两轮,超过上限进入 Benson 决策或失败。

六、最终验收与风险策略

6.1 普通任务默认自动完成

普通问答、只读调查、内部分析、内部文件、低风险数据成果、无外部副作用的模型结果,以及 Benson 当前明确发起且可逆、已登记并通过后置检查的固定系统动作,可以自动完成。

自动完成必须同时满足:

  • 所有必需确定性检查通过。
  • AI BOSS 对所有必需标准审核通过。
  • 没有证据冲突。
  • 没有预算超限。
  • Runtime 风险规则允许自动完成。

普通任务不增加批准单、准入报告、人工窗口或任务启动门禁。最终验收事实写入统一任务状态、成果、证据和审计。

6.2 必须进入 Benson 决策

以下情况必须进入 benson_decision

  • 删除数据。
  • 付款、交易或购买。
  • 外部发信。
  • 外部提交、投递或注册。
  • 不是 Benson 当前明确发起的公开发布。
  • 凭据、权限或安全策略变更。
  • 网络、防火墙或 SSH 变更。
  • 无法恢复的生产变更。
  • 证据不足或检查器不支持。
  • 风险等级未知。
  • AI BOSS 审核与确定性检查冲突。

Runtime 拥有最低风险等级决定权;AI BOSS 和 Worker 不能把高风险降为低风险。Benson 的通过只代表在当前证据与权限下作出最终决定,不能把失败的必需确定性检查改写为已经通过。

6.3 Benson 操作与重开影响

Console 提供验收通过、要求返工、拒绝、重新打开、查看证据、查看版本和查看回滚引用。

重新打开已自动完成任务时:

  • 不删除旧成果或证据。
  • 未开始的依赖任务暂停释放。
  • 已经开始的下游任务标记“前置结果已变更”。
  • AI BOSS 必须重新评估影响并生成结构化建议。
  • 不自动回滚外部动作。
  • 不自动重放模型调用。

七、Console 工作台

AI BOSS 工作台从原四个分区调整为五个分区:

  1. 对话。
  2. 任务。
  3. 成果与验收。
  4. 记忆。
  5. 系统操作。

P5 实施后才增加“主动工作”。

7.1 对话

保留用户消息立即显示、发送/停止、SSE 增量、慢响应提示、模型/数据等级/预算选择、附件/粘贴/拖放及 Token/费用展示。

新增:

  • 复杂目标形成 Plan 后显示计划入口。
  • 最终回复显示成果入口。
  • 能力不足时显示具体能力、执行方式或检查器缺口。
  • 不再使用自然语言“已完成”替代真实任务状态。

7.2 任务

展示 Plan 目标与版本、任务图、并行组、依赖、逻辑 Worker 能力、主节点或 Nomad、Job/Allocation/节点、预算、状态、失败原因、预期成果和打开成果入口。

任务页提供与当前状态匹配的暂停、恢复、取消、显式重试、要求返工、重新打开和重新规划操作。按钮必须由后端能力和状态决定是否可用,禁用时显示真实原因。

7.3 成果与验收

使用列表加详情布局,不使用嵌套卡片。支持:

  • 按 Plan、任务、类型、状态、时间和是否需要 Benson 筛选。
  • 查看成果名称、版本、哈希、大小、来源和限制。
  • 预览安全文本、图片和结构化数据。
  • 打开网站、API、仓库或系统云盘。
  • 复制 Cloudreve 精确路径。
  • 查看验收标准、检查器结果、证据、AI BOSS 审核、返工和版本历史。
  • Benson 通过、返工、拒绝和重开。
  • 自动验收成果展示具体自动验收依据。

7.4 文件访问

  • 小型 SQLite 证据可通过认证接口安全预览。
  • 长期文件不经 Console 或主节点代理完整下载。
  • Console 提供 cloud.yohan.fun 用户入口和精确路径。
  • 只有 Cloudreve 官方用户侧深链接经过真实验证后才提供深链接。
  • 不生成包含系统 WebDAV 密码的 URL,不把 WebDAV 凭据交给浏览器。

7.5 状态文案与响应式要求

正常链路:

计划中
→ 等待执行
→ 执行中
→ 成果待登记
→ 自动检查中
→ AI BOSS 审核中
→ 等待 Benson
→ 已验收
→ 已发布

异常链路必须支持:能力不可用、资源不足、执行失败、检查失败、证据不足、预算耗尽、要求返工、已取消、已回滚和前置结果已变更。

移动端以 390 × 844 为验收视口:不得横向溢出,按钮不得遮挡,详情按区块折叠,成果名称和长哈希可换行,当前任务和验收操作始终可访问。桌面端使用 1440 × 900 验收。所有陌生图标需要 Tooltip,键盘焦点必须获得与鼠标悬停相同的说明。

八、接口与兼容

8.1 新增接口

  • POST /boss/v1/plans
  • GET /boss/v1/plans
  • GET /boss/v1/plans/{plan_id}
  • POST /boss/v1/plans/{plan_id}/cancel
  • POST /boss/v1/plans/{plan_id}/replan
  • GET /boss/v1/tasks/{task_id}
  • GET /boss/v1/deliverables
  • GET /boss/v1/deliverables/{deliverable_id}
  • GET /boss/v1/deliverables/{deliverable_id}/preview
  • GET /boss/v1/deliverables/{deliverable_id}/access
  • POST /boss/v1/tasks/{task_id}/deliverables
  • POST /boss/v1/tasks/{task_id}/verify
  • GET /boss/v1/tasks/{task_id}/verification-runs
  • POST /boss/v1/tasks/{task_id}/acceptance-decisions
  • GET /boss/v1/acceptance-inbox
  • 扩展 GET /boss/v1/capabilities

接口要求:

  • 所有写接口使用幂等键。
  • 所有状态变更校验当前状态和版本。
  • 所有列表接口支持分页和服务端上限。
  • SSE 继续支持断线恢复和 Last-Event-ID
  • 响应不返回凭据、主机路径、Job HCL、完整 Prompt 或隐藏思维链。
  • 接口只经 Console 认证回源代理访问。
  • API Gateway 不增加任务、成果或模型接口。

8.2 兼容策略

  • 现有交互、任务、审核、附件和同步 Smoke 接口继续可用。
  • 旧意图规划接口暂时兼容,并返回新 plan_id
  • 旧任务标记为 legacy-v1
  • 旧 Artifact 映射为 legacy_recorded
  • 不为旧任务伪造 Benson 验收记录。
  • 运行中旧任务保持原策略快照。
  • Console 根据 Runtime 能力目录显示或隐藏新区域;后端不支持时显示真实原因。

九、预算、恢复与审计

  • 规划、Worker 模型、检查分析、AI 审核和返工全部计入 Plan/任务 Token 预算。
  • 规划调用先预留预算;修复调用也计入次数和 Token。
  • 当日总额必须由对话交互尝试和非对话 costs 账本共同计算:对话调用仅从交互尝试计入,避免与成本账本重复;规划、任务执行、检查分析和 AI 审核从成本账本计入。历史记录未保存真实 usage 时必须标记不可重建,不能写为 0 或伪造估算。
  • 2026-08-12,6a45692 已修复非对话账本遗漏并完成生产灰度:Runtime CI 31603368102、Docs CI 31603368024 均成功,运行镜像为 sha256:1615bd1f1f96bdabe5349ef2eeb59e89134b3108904065c30c189dd947be86d4;部署前备份 runtime-pre-p4-budget-accounting-6a45692-20260812T135039Z.db 的 SHA-256 为 ac7fbf4732ec6b1a11c3af81cea48005c158e39d9043800a4d7895506a32b5b5,旧镜像 sha256:7b6909867f0dec774d726ad8931a314ea5723910b82ed3893689e631997299e7 保留为 rollback。生产 /boss/v1/budgets 真实返回当日 110,424 / 500,000 Token、Benson 会话 241,544 Token;健康、quick_check=okroot:root 0600 均通过,自动执行仍关闭。此实现已将已结算的规划、任务执行和审核成本纳入展示和后续对话/重试准入;规划、P4 任务和审核的调用前预算预留仍是未完成项,不能把结算修复表述为完整预留。
  • 2026-08-12,调用前预留已完成仓库最小实现,待 CI 与生产灰度:boss_model_reservationsplanner_runtime_call_idtask_runs.run_id 或新生成的审核调用 ID 唯一记录规划、P4 主节点任务和 AI BOSS 审核。每条调用在上游网络请求前用 BEGIN IMMEDIATE 检查当日硬上限并预留;真实 usage 结算后以 reservation_id 关联原有成本账本,防止日预算和会话预算双计。usage 缺失、未知上游异常与 Runtime 重启按预留值估算结算,绝不自动重放;调用前取消可以释放预留。规划修复调用使用独立预留;P4 任务使用冻结 token_budget,审核使用冻结任务预算与档位基线的较小值,旧任务回退到档位基线。该最小闭环暂不覆盖旧逻辑 Worker 或批结果分析端点,不能据此宣称所有模型调用均已预留。
  • 2026-08-12,8ce9a97 已完成生产灰度:Runtime CI 31605567516、Docs CI 31605567443 成功;部署前备份 runtime-pre-p4-nonconversation-reservations-8ce9a97-20260812T141441Z.db 的 SHA-256 为 20af62f8d152adfacec4354b04a38fbb2b727cb897ef16097bcaa30dc78a2712,生产镜像为 sha256:162bf04f08427bfe606da29f048b1b739f91d923e25b23df4f58843dd2353540,健康、quick_check=ok 与数据库 root:root 0600 均通过。生产计划 8195535ffb454f99b263a46d5dda0090 在网络调用前真实预留 9,000 Token,返回 usage 后结算 6,306 Token;脱敏实际路由事实为 kr / claude-sonnet-4.5,仅说明本次 OmniRoute Combo 路由结果,不构成固定 Provider/模型承诺。该公开、无副作用计划只创建一个 queued 任务,随后由 Benson 显式取消且任务最终为 cancelled;没有 Nomad、Worker、系统动作或外部操作。自动执行保持关闭。该次生产证据只覆盖规划预留;P4 主节点任务、AI BOSS 审核和失败/重启预留恢复仍需分别进行真实灰度验证。
  • 2026-08-12,后续主节点任务与审核灰度发现任务级硬上限缺口:任务 4936cd5b59904dae 的冻结 token_budget=8,000,执行与审核分别在调用前预留 8,000,但 Provider 真实 usage 为 10,08411,764,任务仍被旧逻辑验收完成。该历史记录保留为真实证据,不回写或伪造为未超额;它证明预留/结算链路存在,但不能证明任务预算硬上限有效。修复将 token_budget 明确为任务的总模型额度:主节点任务必须至少覆盖一次执行加一次 AI BOSS 审核,Nomad 任务必须至少覆盖一次 AI BOSS 审核;不足时计划校验或调用前拒绝。调用后若 Provider 的真实或保守估算用量仍使任务超额,Runtime 停止后续调用且禁止自动验收。该修复完成前,P4 预算出口仍不满足。
  • 非模型确定性检查 Token 为 0,但记录执行耗时与资源事实。
  • 模型任务预算总和不得超过 Plan 硬上限。
  • 任务之间不自动借用预算,运行中不提高预算档位。
  • 瞬时模型错误最多自动重试一次。
  • 计划修复最多一次。
  • 返工最多两轮。
  • 达到任何硬上限立即停止并保留已有成果和证据。
  • Runtime 重启恢复 Plan、任务、成果、检查和决定状态。
  • 未完成模型调用标记为 interrupted,不得自动重放。
  • 所有计划、检查、审核、人工决定、返工、重开、发布和回滚写追加式审计。
  • 故障告警只向 API Gateway 发送 HMAC 脱敏摘要,不发送成果正文、凭据或内部安全引用。

十、文档库与计划体系同步

10.1 架构文档

批次 0 必须同步:

  • 项目宪法:增加“执行完成不等于成果验收完成”。
  • 总体架构:增加 Plan、任务、成果、检查、审核和最终验收数据流。
  • 核心模块:冻结 AI BOSS、Runtime、Nomad、Worker 和检查器职责。
  • 技术选型:记录继续使用 FastAPI、SQLite、SSE 和 Nomad 验证 Worker 的原因。
  • 存储架构:记录 WebDAV 权限确认和成果存储路径,消除长期 Artifact 状态冲突。
  • 工程规范:增加成果、证据、验收、状态和审计规范。
  • 部署规范:增加数据库备份、功能开关、灰度、回滚和回读。
  • AI 协作规范:明确 AI BOSS 是语义总控,但不能绕过确定性边界。
  • 开发路线图:P4 重新开启,P5 等待。
  • 系统总结:取消“P4 全部完成”的现行表述。
  • AI 平台与应用架构:增加智能编排和成果闭环。
  • Runtime 模型适配层:增加结构化规划和结构化审核。
  • 架构入口和项目交接:指向本权威计划。

10.2 计划与状态系统

同步更新 state.json、当前执行摘要、计划看板、后续路线、计划历史、旧 P4 归档更正、P5 等待条件、文档索引、Docs 导航和机器状态检查脚本。

统一状态口径:

当前阶段:阶段四
标题:AI BOSS 智能编排、通用成果与验收闭环
状态:进行中
下一阶段:阶段五 AI BOSS 受控主动工作循环

原 P4 完成归档不得覆盖或删除,只追加更正说明:原对话、预算、上下文、记忆、附件、多模态、SSE、CLI Gateway 和 API Gateway 验收继续有效;后续审计确认智能编排和成果验收未达到最终出口,因此 P4 重新开启。

10.3 未来 AI 任务计划模板

未来所有 AI 任务计划必须写明目标、Worker 能力、预期成果、成果存储位置、验收标准、自动检查器、证据、AI 审核、Benson 决定条件、风险、回滚、Token 预算和生命周期。

十一、实施批次

批次 0:文档治理和权威计划落盘

  • 创建本权威文件。
  • 更新状态源和全部计划页面。
  • 更新全部相关架构文档。
  • 更新计划模板和状态检查器。
  • 为原 P4 归档追加更正。
  • 验证 Markdown/JSON/Python 为规定编码和换行风格。
  • 运行计划状态检查、链接扫描、严格 Docs 构建和 git diff --check
  • 使用 codex/p4-ai-boss-delivery-closure 分支提交并推送 GitHub。
  • 等待 GitHub Actions 通过,部署 Docs 镜像,核对镜像摘要和公网正文。
  • 以本批次精确 Git 提交创建完整执行目标。

批次 1:统一上下文、记忆与模型通道闭环(P4 主线前置)

本批次在继续 P4 智能编排主线前完成。目标是让 AI BOSS 在所有已登记模型间使用同一份 Runtime 权威上下文和记忆,并把模型通道、多模态与记忆工作台真正跑通。采用 SQLite + FTS5 + sqlite-vec 混合检索:SQLite 继续保存唯一权威事实、版本和审计;FTS5 与向量检索只产生候选,使用 RRF 合并后仍按确认状态、来源、版本替代、关联关系和 Token 成本做可解释排序。不引入独立向量数据库、第二记忆服务或预设通道/并发配额。

2026-08-13 的仓库实现检查点如下,不能代替生产验收:

  • 44e41ec 已实现 Runtime ContextPlanner v2、SQLite 旧库增量迁移、sqlite-vec==0.1.9、本地 Unicode n-gram 向量候选召回、FTS5/向量 RRF、确认/删除/替代记忆过滤、不可变 context_manifest v2、使用次数和最近使用记录。本地专项回归覆盖这些路径;向量仅是本地候选召回,不称为外部语义模型或第二权威记忆库。
  • 7984b9e 已实现 Console 记忆搜索和上下文清单展示,包含来源、确认者、版本、替代关系、使用次数、最近使用、规划器版本、分段预算、选入和省略原因。桌面和 390 × 844 浏览器契约通过;该提交同时修正默认 Codex/Claude 线路同步和编辑表单残留 API Key。
  • Runtime 的每个 OmniRoute AI BOSS 请求固定发送官方 X-OmniRoute-No-Memory: true;独立回归测试验证 Header 与 runtime_call_id 均会外发。2026-08-14 隔离实验前的生产只读核对显示官方 3.8.49 运行且全局 Memory 关闭;当时“专用 Key 开启 Memory 后跨 Key 不可检索、Runtime 请求不注入也不自动写入”的生产隔离实验尚未开始。后续实验和当前状态以紧随其后的生产证据为准。
  • 2026-08-14,e3d9dc5 的 ContextPlanner/Memory 收口已按 Runtime → Console → Docs 发布;部署前 Runtime SQLite 备份 runtime-pre-context-production-20260814T025104Z.db 的 SHA-256 为 d2e1922d51c7b48d81d4d2ef4617a3b5475404914cccbfd7e36eba43bd7ef22b。Runtime Actions 31764496053、Console Actions 31764496171、Docs Actions 31764495831 均成功;随后部署脚本修正 98d9b4c 移除了违规的 Worker SSH 预加载/构建路径,Runtime Actions 31764888785 与 Docs Actions 31764888789 成功。生产 Runtime 镜像 sha256:d31742650b0519c853273dc2156ea6074e5869d5e2cf4183d79a552468c22ef4、Console 镜像 sha256:3e71545e91a13ed6967696be189a8787f195a698d9cce7112094ba59ed818c48、Docs 镜像 sha256:f3edecf8ba329ef0b7cea3a541e39fd282d69af4b33467ffb6b8194c0315124c 均为健康运行版本。生产 Runtime quick_check=oksqlite-vec 导入、Memory/Preferences/Context Manifest API 均通过;重启后同一清单仍保留 19 条选入记录。管理员真实浏览器验收通过桌面与 390 × 844:六个工作区可用、Context Manifest 可读取、移动端无横向溢出。7f746ae 又将移动端工作区标签改为两列换行并加入“标签不得截断”浏览器断言,Console Actions 31765493038 成功且已发布。公网 Console 未认证入口仍返回 A-Auth 302,Docs 公网正文可检出本节证据。
  • 2026-08-14,OmniRoute 自身的专用 Memory Key 隔离实验完成:变更前 /root/.omniroute/storage.sqlite 备份 SHA-256 为 c3c2d99c62bdb93ecb8a8084adad74f8554cf2f9e0f9b975cb149f9fe8f95cd7,专用 Key 仅保存在主机 /etc/agentmeshos/omniroute-core/memory.envroot:root 0600),不进入 Runtime、Console、Worker、Git 或模型上下文。官方 3.8.49 的内置 OpenAPI 将 Key 创建字段误写为 label,实际服务要求 name;首次 HTTP 400 未创建资源,二次最小验证后才以正确契约创建。Memory 已开启为 enabled=trueretentionDays=7maxTokens=256strategy=hybridskillsEnabled=false。合成短期记录只可由专用 Key 的 apiKeyId 通过检索预览返回,独立 Probe Key 返回 0;Runtime Key 以 X-OmniRoute-No-Memory: true 完成一次真实 /v1/chat/completions 请求(HTTP 200)后总记录数仍为 1。随后测试记录和 Probe Key 均已删除,记录总数回到 0。结论是 OmniRoute Memory 可供自身独立用途使用,但 Runtime AI BOSS 继续显式退出该链路,Runtime SQLite 不存在双写或跨会话污染。
  • 2026-08-14,网页验证器的 Cloudreve 公网导入灰度完成仓库与 Runtime 发布收口:0214cc3 将能力可用性改为显式 AI_RUNTIME_WEB_VERIFIER_ENABLED,并在直接任务入口重复校验,避免自动提交绕过灰度;验证器 HCL 使用已导入 OCI 包的本地 Docker config image ID sha256:0bb1a12fe6255d36a23fc4871258f00cfbf7264a8677a0deb3712f15b1cb128fforce_pull=false、103 专属网络且无回调/Artifact Token。回收端只接受真实 PNG/JPEG/WebP 截图。1a5babf 修复测试夹具后,Runtime Actions 31766926276 成功;Runtime 已备份 SQLite 和环境后部署 sha-1a5babf,健康、私网拓扑和 quick_check=ok 通过。最小公开 example.com 的 HTTP、文本和截图任务 de0cbae385f34aed 被 Runtime 正确提交,但 Nomad 当时只看到 dedirock-717106053r1049668,固定的 pcdell-103 已离线,故 Job 没有 Allocation。经 Tailnet 和 Office LAN 二跳 SSH 均未取得 banner,不能以镜像或 Runtime 原因冒充节点故障。未启动 Job 已通过任务生命周期接口取消并确认从 Nomad 消失,功能开关已恢复 false,能力目录如实返回 web_verifier_not_enabled。因此网页验证器隔离、任务包、CI 与提交路径已完成,但真实 Nomad 浏览器验收仍阻塞于 103 恢复在线、重新注册为 ready/eligible 后的同一最小任务;P4 不得因本轮而标记完成。
  • 2026-08-14,103 恢复 ready/eligible 后,网页验证 Worker 的真实生产验收完成。旧导入镜像 2233d0ea... 因缺少 Playwright 而失败,保留为失败根因;GitHub Actions 31775604603 发布的浏览器镜像经 cloud.yohan.fun 公网数据面导入 103,Cloudreve 归档 AgentMeshOS-节点共享/web-verifier-sha-7eb9b20.tar 的 SHA-256 为 01ba611760fda4549ebdd5a0aaa6557987ddd72fa940549d94bdb41779c0789c,103 本地 Docker image ID 为 sha256:e5b94607dfc76d33622c28a352fbd6e1d1b8e635ea5875ed425e1e50ff700410,以 10001:10001 运行且 import playwright 通过。42c3953 将 Runtime 固定引用切换到该已验证 image ID,随后发现 Nomad 客户端日志 API 将 stdout 包装为 Base64 Data 字段;118bdd1 解包该官方响应并添加回归,Runtime Actions 3177854649431778925418 成功,生产 Runtime 已部署 sha-118bdd1,部署前 SQLite 备份 runtime-pre-web-verifier-20260814T070620Z.dbruntime-pre-nomad-log-decode-20260814T071215Z.db 均为 SHA-256 ac7fbf4732ec6b1a11c3af81cea48005c158e39d9043800a4d7895506a32b5b5,部署后健康和 quick_check=ok。真实任务 8dd273865175492c 的 Allocation dafeb175-7048-e5c3-2e27-f39f65d39babpcdell-103 完成:HTTP 200、Example Domain 文本和 h1 截图均通过;Runtime 回收 JSON Artifact(SHA-256 d685be882f2f5171bb5aa669b5ed16e4b013cdc8fb31fb8b07990ae32c638cf4)并登记成果,截图 SHA-256 为 60969169777c9a31030f32c0efd93b10d6d68caf3167d701cb2a70f1a44880fd。任务准确停在 boss_review 而非 completed,Job 已通过 Runtime 生命周期接口清理。验证 Worker 未获得 WebDAV、Provider、Nomad、SSH 或 Docker 凭据;P4 自动执行仍为 false,本项仅收口 P4 主线前置的真实网页检查器验收,不代表 P4 完成。
  • 2026-08-14,P4 最终场景补充灰度使用已通过 Smoke 的 anbalu / Codex CLI / gpt-5.6-terra00147a2 让严格规划冻结当前 BOSS 通道,1e15ee7 把冻结的 BOSS/Worker 通道写入新 Plan 的任务规格,旧 Plan 保持原 OmniRoute 语义。两个无依赖 boss.reasoning/v1 任务在同一秒显式派发、各自独立运行,证明 Runtime 未把同一通道人为串行化;两项确定性 Artifact 检查通过后,AI BOSS 结构化审核因无可引用的成果证据分别要求返工,Runtime 没有假通过,验收 Plan 随后显式取消并保留证据。6a29dce 增加 APK 包结构检查;真实 software.package 成果 cf72ff180fe749ef96395aadf9e6ebe8 经 Cloudreve 长期目录回读,SHA-256 6b99cfd767ba6396f73b7825e62ccad629df51bc5b85b26f04cc9c947b710618、721 bytes、APK 头、4 个归档条目、AndroidManifest.xmlMETA-INF/CERT.RSA/CERT.SF 元数据均通过,明确不声称可安装或签名密码学有效。部署前 Runtime SQLite 备份分别为 p4-planner-channel-before-00147a2-20260814T090002Z.dbp4-task-channel-before-1e15ee7-20260814T091017Z.dbp4-apk-verifier-before-6a29dce-20260814T091747Z.db;当前 Runtime sha-6a29dce 重启后健康、quick_check=ok,已取消 Plan、APK 成果和唯一验证记录均保持。管理员 API Key 已换取 HttpOnly 会话并真实打开 Console 桌面与 390 × 844 移动工作台,无横向溢出;BOSS 主题、交互/通道元数据、工作区标签与 Docs iframe 正文均可见。

  • 2026-08-14,网页验证器生产证据追加更正:上述早期浏览器镜像验收曾正确发现任务 5ebdc542aa954317 失败,根因是当时导入镜像缺少 Python Playwright(ModuleNotFoundError),该任务已通过 Runtime 生命周期接口取消且 Nomad Job 已清理,未把失败伪写为通过。随后从 Cloudreve 公网数据面取得已验证浏览器基底,重新构建并经同一公网数据面导入 103;传输归档 web-verifier-sha-7eb9b20.tar 的 SHA-256 为 01ba611760fda4549ebdd5a0aaa6557987ddd72fa940549d94bdb41779c0789c,103 已导入 image ID 为 sha256:b28eee08c767467056aa6dc78e27302f60586ea9a7841e54539f906dc6dd49a1,以 10001:10001 运行且 import playwright 通过。861f3fd 将 Runtime 固定为该 image ID,Runtime Actions 31792149198 成功;部署 Runtime OCI 摘要为 sha256:d7929d34bf3a6dd5547b0299fec907db9b016ead6fb735034f8e802c58ce4ec5,部署前 SQLite 备份 runtime-pre-browser-verifier-20260814T102725Z.db 的 SHA-256 为 fad4fac9e6f5492719c166d79a8ff21530d9b649f1600338837f7588cbf84a9a,健康与 quick_check=ok。新任务 e76fee245be3405f 在 103 Allocation cf217360-762e-2d4e-199d-7ce18363a090 通过 DNS、TLS、HTTP 状态、文本和截图五项检查;Runtime 回收 JSON Artifact SHA-256 1a2cedbebc4367017659160c6da52a133e0be1e6c7338b8cb796a250010ac9a7、截图 SHA-256 60969169777c9a31030f32c0efd93b10d6d68caf3167d701cb2a70f1a44880fd,登记成果 e906cce0cb0948f88cd94f13728aed0c。任务准确停在 boss_review,没有越过审核伪完成;其 Nomad Job 已由 Runtime 清理。Worker 仍未取得 Cloudreve、Provider、Nomad、SSH 或 Docker 凭据,P4 自动执行与 P5 均继续关闭。

  • 增量迁移 ContextPlanner、分段 context_manifest v2、记忆来源/版本/替代/确认者/使用记录与向量索引元数据;旧消息、记忆、摘要、附件、任务、成果和现有清单必须继续可读。

  • 安装并在 Runtime 镜像固定 sqlite-vec;向量嵌入由 Runtime 受控能力生成,原文与向量索引均在 Runtime SQLite,不能把业务记忆交给 OmniRoute、Provider 或外置服务。
  • 先实现“只生成清单、不改变 Prompt”的 ContextPlanner 灰度:真实或保守 Tokenizer、模型能力快照、分段预算、选入来源、检索分数、被省略原因和输出预留全部持久化。
  • 启用 FTS5 + 向量混合候选召回、RRF、版本替代去重和可解释排序;结构化、分层、版本化滚动摘要覆盖确认决定、约束、完成事项、未决问题、活动任务及成果/证据引用。
  • 通过按会话灰度把 ContextPlanner 接入实际 Prompt;验证 OmniRoute、Codex、Claude 与 Anbalu 切换后连续,Runtime 重启后可恢复,普通模型回答不自动升级为确认事实。
  • 记忆标签升级为 Runtime 控制中心:搜索、编辑、确认、删除、来源、版本、替代关系、关联消息/任务/成果/证据、最近使用、context_manifest 选入或省略原因均可查看;不建立第二记忆库。
  • 所有已启用通道进入对话下拉,去除 Gateway/Runtime 对通道数和总并发的代码夹紧;以真实上游行为为准。完成同一通道并发、取消隔离和临时目录隔离验收。
  • 分别完成 OmniRoute、Codex、Claude、Anbalu 的最小真实文本对话与切换连续性验收;为支持图片的通道补真实图片 Smoke 和持久化资格。Codex Direct API 在有用户配置的通道后分别验收 Responses 与 Chat Completions,不预先声称可用。
  • 已完成:为 OmniRoute 自身用途创建独立 Memory Key,最小范围启用 Memory 并验证跨 Key 不可检索;AI BOSS 请求携带官方 x-omniroute-no-memory: true 的真实调用未自动事实写入,未与 Runtime 记忆双写。它不是 AI BOSS 的事实库;验收基于正式 3.8.49,不以未发布 3.8.50 分支为前提。
  • 完成本机、生产和管理员公网浏览器回归:通道增删改、启用/停用/刷新、角色默认、所有可用通道直接选择、记忆工作台、清单查看、文本/图片能力、并发、模型切换和重启恢复。
  • 每项代码、Runtime、Gateway、Console、Docs 与生产证据独立提交、推送、CI 与回滚验证;全部通过后才进入下一批次。

批次 2:数据库和兼容读取

  • 备份 Runtime SQLite 并执行 quick_check
  • 增量新增表、字段和索引。
  • 增加旧任务、旧 Artifact 兼容映射。
  • 增加只读 Plan、成果和验收接口。
  • 新能力默认关闭。
  • 验证旧 Runtime 数据和旧 Console。
  • 提交并推送 GitHub,CI 通过后进入下一批次。

批次 3:智能规划和能力目录

  • 实施模型结构化规划和一次计划修复。
  • 实施能力目录及不可变快照。
  • 实施 DAG、资源、数据等级、风险和预算校验。
  • 实施并行、依赖、能力不足和一次重新规划。
  • 提交并推送 GitHub,CI 通过后进入下一批次。

批次 4:成果和检查器

  • 实施成果与证据登记。
  • 实施 Runtime 轻量检查器。
  • 构建并发布 Nomad 验证 Worker。
  • 实施 URL、文件和解析安全限制。
  • 实施检查状态持久化与重启恢复。
  • 提交并推送 GitHub,CI 通过后进入下一批次。

批次 5:AI 审核和最终验收

  • 替换旧自动审核决定逻辑。
  • 实施结构化 AI BOSS 审核。
  • 实施普通任务自动完成策略与 Benson 决策。
  • 实施返工、重开、版本替代、依赖释放和前置结果变更处理。
  • 提交并推送 GitHub,CI 通过后进入下一批次。

批次 6:Console 成果中心

  • 调整为五个分区。
  • 增加任务控制、成果列表与详情。
  • 增加安全预览、Cloudreve 用户访问入口、证据、检查和审核展示。
  • 增加 Benson 操作和版本历史。
  • 完成桌面、移动端、键盘和 Tooltip 测试。
  • 提交并推送 GitHub,CI 通过后进入生产灰度。

批次 7:生产灰度

功能按以下顺序启用:

  1. 新数据库和只读成果页面。
  2. 智能规划但不自动执行。
  3. 手动测试 Plan 执行。
  4. 检查器和 AI 审核。
  5. 普通任务自动完成。
  6. Benson 高风险决策。

发布顺序固定为:

验证 Worker 镜像
→ Runtime
→ Console
→ Docs

每一步分别记录 Git 提交、GitHub Actions、镜像摘要、数据库备份、健康、真实接口、真实任务和回滚结果。生产数据库迁移、功能开关和状态切换必须串行执行。

批次 8:统一上下文与记忆专项(已前置并入批次 1)

本节保留为专项完整规格,实施顺序已调整为批次 1,必须在继续智能编排、成果与验收主线前完成。它是 Runtime 自主模块,不把 OmniRoute Memory 用作 AI BOSS 的权威记忆;OmniRoute 继续负责已选模型的路由、调用事实和健康,不保存或决定 AI BOSS 的业务上下文。OmniRoute 可使用独立、经过隔离验证的自身 Memory,但 Runtime 的 AI BOSS 请求必须显式退出其自动注入链路。

7.1 目标与权责

  • Runtime 读取并组装所有模型通道共用的上下文,持久化每次交互的上下文清单;模型本身没有跨调用记忆。
  • Runtime 是会话、记忆、摘要、任务、成果、证据、风险和删除请求的唯一权威。OmniRoute、CLI Agent Gateway、Provider 和模型都不是第二记忆库。
  • 每份注入材料必须可追溯到消息、确认记忆、摘要、计划、任务、成果、证据或附件;模型输出不得自动成为系统事实。
  • Console 必须显示“本次使用了什么上下文、来源、估算 Token、为何选入及为何省略”,但不返回完整 Prompt、隐藏思维链、凭据、主机路径或不具查看权限的正文。

7.2 上下文装配器

新增 Runtime 内部 ContextPlanner,以明确分段预算替代字符串拼接和“字符数除以四”的裁剪。每次调用产生不可变 context_manifest,至少保存交互 ID、会话 ID、模型能力快照、各段预算、估算方法、选中来源 ID、遗漏原因、总输入预估和输出预留。

装配顺序固定,前一段不能被后一段静默挤掉:

  1. 系统约束、权限和数据处理边界。
  2. 当前 Benson 目标、活动 Plan、未完成任务、验收状态和明确限制。
  3. 与当前请求直接相关的已确认决定、项目事实和用户偏好。
  4. 版本化滚动摘要中的相关段。
  5. 最近会话原文。
  6. 经过校验、受独立预算限制的附件摘录、工具结果、成果或证据摘要。
  7. Benson 当前消息和固定输出预留。

必须使用真实 Tokenizer;在后端没有可用 Tokenizer 时,使用按模型目录冻结的保守估算器和安全余量,不能使用字符截断。模型目录必须声明输入窗口、最大输出、图片/文件能力和推理强度支持;任何不确定能力都以更小的安全窗口处理并在清单中说明。

7.3 记忆、摘要与检索

  • 保留已确认记忆、候选记忆、用户偏好、确认决策、项目事实、当前目标和摘要的区分,保存来源、数据等级、状态、版本、替代关系、时间和删除标记。
  • 明确“记住”可创建待审计的用户记忆;权威 Runtime 事件可写入系统事实;普通对话仅生成候选或摘要,必须经确认后才成为长期事实。
  • 摘要改为结构化、分层且版本化,至少包含已确认决定、当前约束、完成事项、未决问题、活动任务、成果/证据引用和覆盖消息范围。摘要不是系统事实。
  • 首先使用现有 SQLite FTS5 召回候选,再依据会话/Plan/任务关联、确认状态、权威来源、显式重要度、相关性、时效、数据等级、版本替代和 Token 成本做可解释排序与去重。
  • 直接在 Runtime SQLite 增加 sqlite-vec,与现有 FTS5 采用 RRF 混合召回;不引入 Qdrant 或其他外置向量数据库。向量用于解决语义相近但字面不同的候选发现,FTS5 保留精确术语、ID、文件引用和中文关键词召回。
  • 向量相似度只能产生候选,不能覆盖确认状态、来源权限、任务关联、版本关系或确定性 Token 预算;最终排序、去重和选择必须可解释,并由 Runtime 持久化到清单。

7.4 模型与数据边界

  • 统一上下文由 Runtime 先完成选择,向已批准后端发送同一语义上下文;不同模型的窗口、模态和推理能力只影响容量或能力拒绝,不得导致同一会话被静默拆成“公开记忆”和“私有记忆”。
  • Codex、Claude 或未来通道若要承接含受限材料的对话,必须先有明确的服务账号、数据处理边界、真实 Smoke 和能力目录登记;没有通过时,Console 显示不可用或要求 Benson 选择 Runtime 生成的脱敏摘要,不以错误标签冒充隔离。
  • 当前已部署的 CLI Agent Gateway 仍是每次新建的隔离 CLI 子进程,不是 Benson 正在使用的 Codex Desktop 会话;不得复制桌面会话、~/.codex 配置或凭据进入 Gateway。新增外部 Codex/Anbalu 等提供商只能使用独立 root-only 服务凭据、固定白名单模型和逐模型真实 Smoke。
  • 普通 AI BOSS 对话的默认模型、模型通道和推理强度由 Console 中持久化的 Benson 偏好决定,而不是代码硬编码;2026-08-13 已实现持久化偏好、后端白名单推理强度和系统托管通道列表。未配置成功的静态 anbalu-codex-gpt-5.6-terra 候选已删除;任何提供商均须在 Console 填写独立服务 URL/Key、读取或手填单模型、完成真实 Smoke 后才可保存并启用。它不改变 P4 规划、任务执行和审核的既有模型快照。
  • 模型通道管理必须同时列出系统托管 OmniRoute、已登记的静态 CLI 通道和可编辑的动态通道。动态通道采用“添加通道”入口与逐行编辑,不手填名称:以 提供商 / Codex 或 Claude / 模型 自动生成;编辑时 API Key 永不回显。目录使用明确表头,分别显示当前 BOSS、当前 Worker、当前 Codex、当前 Claude。四类状态均以按钮状态显示,可设为当前;点击当前项恢复角色或 CLI 的自动选择。Codex 与 Claude 的当前通道独立,恢复或切换任一类不得改变另一类。
  • 对话工具栏中的模型通道、推理强度、单次预算档位和每日用量均使用下拉选择,以避免窄屏截断。推理强度固定支持极低、低、中、高、极高五级,默认中;单次预算保守、均衡、宽松扩大为输入 80k/120k/240k、输出 10k/20k/40k、规划 40/60/100 次、单任务 400k/1M/2.5M,默认新增“无限制”。无限制取消 Runtime 的单次、规划和任务 Token 档位上限,但每日总量、模型自身上下文、重试与返工边界仍生效。每日用量默认 5M,并提供 M 级预设、自定义和 0(只取消当天总量上限)。桌面端控件按内容自适应,390 × 844 下纵向排列;通道表在移动端保留带表头的受控横向滚动,而不是压缩或隐藏状态列。

7.5 评测、迁移与发布

  • 建立仅含已授权或脱敏案例的评测集,覆盖长期会话、模型切换、相似但已替代的决策、冲突记忆、附件、活动任务、成果引用和预算紧张场景。
  • 以正确召回率、错误/过期召回率、冲突率、上下文 Token、首字延迟、回答连续性和模型切换一致性为指标;向量索引与 FTS5 同批上线,但不达标时可按会话关闭向量召回并保留索引、清单与评测证据。Compression 仍须单独通过保真评测后才可进入任何可选链路。
  • 迁移只新增摘要版本、检索元数据、上下文清单和索引;旧消息、旧记忆、旧附件、任务和成果保持可读,不批量把历史模型文本写成确认事实。
  • 先灰度只生成清单、不改变发送 Prompt;经 Console 只读核验和回归后,再按会话启用新装配器。发生回归时回退至旧装配器,保留清单和原始记录用于审计。
  • OmniRoute Compression 不进入 AI BOSS 正式上下文链路,除非未来作为 OmniRoute 已选 Prompt 的可选下游压缩实验通过错误码、JSON、数字、任务约束、验收标准和文件引用的保真评测;它不得写入、删除或决定记忆。OmniRoute 其他独立用途的 Compression 配置不构成 AI BOSS 已启用。

批次 9:P4 最终归档

  • 创建新的 P4 最终完成归档并保留原 P4 历史归档。
  • 记录自动化测试、真实生产场景、镜像、数据库、Console 和公网证据。
  • 更新状态源,使 P5 恢复为规划中,尚未实施。
  • 提交并推送 GitHub,部署 Docs 并验证公网正文。
  • P5 不自动开始实施。

十二、并行协作与文件所有权

主智能体负责架构决定、数据模型、API 契约、共享状态、集成、生产发布和最终结论。

以下低冲突工作可以在明确文件范围、输入契约和验收标准后并行:

  • 架构文档扫描。
  • Runtime 单元测试整理。
  • 检查器测试夹具。
  • Console 布局和浏览器测试。
  • Docs 一致性检查。
  • 生产只读证据收集。

以下共享状态和高冲突工作必须串行:

  • SQLite 迁移与 Store 修改。
  • Task 状态机。
  • Planner 与审核核心。
  • 同一 Console 文件的大范围修改。
  • 生产数据库迁移。
  • 最终部署和状态切换。

子智能体不得同时修改高冲突文件;主智能体必须复核所有子智能体输出和实际 Git diff,不能把子智能体自述当作完成证据。

十三、测试计划

13.1 单元与集成测试

必须覆盖:

  • 合法 Plan、非法 JSON、一次修复成功、第二次失败停止。
  • 循环依赖、重复任务、超限任务和依赖深度。
  • 不存在能力、不支持数据等级、执行方式不匹配和资源超限。
  • 预算超限、风险不能降低、任务间不能借用预算。
  • 成果字段、验收标准、证据关联和版本替代。
  • 检查器失败、不可访问证据和 AI 审核引用伪证据。
  • 自动验收、Benson 验收、拒绝、返工上限和重开影响。
  • 幂等、显式重试、取消、重启恢复和旧库迁移。

13.2 安全测试

必须拒绝或正确转人工:

  • localhost、私网、Tailnet、云元数据、重定向私网和 DNS 重绑定。
  • file:// 和非 HTTP 协议。
  • 伪 MIME、压缩炸弹、图片炸弹、超页 PDF 和恶意包。
  • 任意 Shell 字段和任意主机路径。
  • WebDAV、Provider、Nomad、SSH 和 Bridge 凭据进入响应、日志、Worker 或模型上下文。
  • Console 绕过 Runtime 直连 Operation Bridge。

13.3 浏览器测试

桌面使用 1440 × 900,移动端使用 390 × 844。必须验证五个分区、任务图、成果列表、成果详情、检查进度、自动验收、Benson 操作、返工、重开、错误、Cloudreve 不可用、Runtime 中断、SSE 重连、无横向溢出、无遮挡、键盘操作和 Tooltip。

接口检查不能替代真实浏览器验收。生产前使用 Playwright 截图和布局检查,所有截图、日志和中间文件统一写入仓库 temp/

13.4 生产场景

至少真实完成:

  1. 普通问答自动验收。
  2. 多任务 Plan。
  3. 两个无依赖任务并行。
  4. 依赖任务等待前置最终验收。
  5. 公开资料任务进入 Nomad。
  6. 文件写入 Cloudreve 并回读 SHA-256。
  7. 网站完成 DNS、TLS、HTTP 和浏览器检查。
  8. 数据文件通过 Schema 和质量检查。
  9. APP 包只验证实际可验证字段,不虚报可安装。
  10. 检查失败触发返工。
  11. 新版本替代旧版本。
  12. 高风险任务等待 Benson。
  13. 自动完成任务被 Benson 重开。
  14. Runtime 重启恢复。
  15. 重复提交不重复调用模型或消费 Token。
  16. P5 主动循环保持未启用。

13.5 本地依赖与临时文件

  • 固定使用仓库根目录 .venv
  • 使用正式 bootstrap 脚本一次性安装测试依赖,不重复临时安装 pytest
  • Node 依赖使用锁文件。
  • 测试中间产物统一进入项目 temp/
  • 不把截图、日志、临时数据库或调试脚本散落到其他目录。
  • 缺失依赖时先确认归属、版本、包源和安装边界,在项目隔离环境或正式目标环境安装后继续原验证;不能把第一次缺依赖直接作为任务结论。

十四、发布、功能开关与回滚

功能开关至少覆盖:

  • P4 数据库只读能力。
  • 智能规划。
  • 自动执行。
  • 检查器。
  • 自动验收。
  • Console 成果中心。

回滚原则:

  • 所有 SQLite 迁移保持增量兼容。
  • 旧 Runtime 可以忽略新表,但不能处理新状态。
  • 回滚前停止新的 P4 Plan 进入,等待或取消运行中 P4 任务。
  • 新表、成果、证据和长期 Cloudreve 文件不删除。
  • Console 检测后端能力;不支持时隐藏新操作并显示真实原因。
  • 保留上一版 Runtime、Worker 和 Console 镜像摘要。
  • 回滚后验证数据库 quick_check、服务健康、旧对话、旧任务、附件和记忆。

GitHub 和发布要求:

  • 使用 codex/p4-ai-boss-delivery-closure 分支。
  • 每个批次独立提交,每次提交立即推送远程。
  • CI 通过后才能进入下一生产批次。
  • 正式部署使用合并后的主分支镜像。
  • 不允许只修改本地不推送。
  • 文档、代码、生产和公网验收分别记录,不能互相代替。

十五、P4 最终出口

以下条件必须全部满足,才允许再次声明 P4 完成:

  • 本权威计划和相关架构文档已经提交、推送、构建、发布并通过公网正文验收。
  • 当前状态源不再错误显示旧 P4 已完成。
  • AI BOSS 使用模型结构化规划,不再依赖关键词固定单任务。
  • AI BOSS 能选择登记能力、主节点或 Nomad 执行建议、依赖和并行关系。
  • Runtime 能拒绝非法、超预算、高风险降级或不可用计划。
  • Nomad 只负责具体节点放置,不承担业务语义派工或审核。
  • 任何成果都能登记、展示、追踪版本和人工验收。
  • 常见成果具有真实检查器,不支持成果明确转人工。
  • 证据必须真实可访问,不能以字符串或模型自述代替。
  • AI BOSS 审核结论真正参与最终决定。
  • 普通任务按确认策略自动完成,高风险任务进入 Benson 决策。
  • completed 只表示最终验收完成。
  • Console 能查看成果、证据、检查、审核、版本和安全访问入口。
  • Benson 能通过、返工、拒绝和重开。
  • 旧任务、消息、Artifact、审核、记忆和附件保持可读。
  • Token 预算、预留、结算、重试和返工硬上限有效。
  • Runtime 统一上下文与记忆专项:会话、确认记忆和滚动摘要已由 Runtime SQLite 作为唯一权威,ContextPlanner v2 已把可解释 FTS5/本地向量 RRF、确认/删除/替代过滤、分段预算、输出预留和不可变上下文清单接入实际 Prompt。模型切换不得改变会话身份或记忆归属,普通模型回复不会自动升级为确认事实。其余出口是完整本机/CI/生产/公网回归,以及 OmniRoute 专用 Key 的独立 Memory 隔离实测;全局 Memory 关闭时不得以静态源码或未写入结果伪造该实测。
  • WebDAV、Provider、Nomad、SSH 和系统动作凭据边界没有被破坏。
  • Runtime、验证 Worker、Console、Docs、数据库迁移和生产真实场景全部通过。
  • GitHub、本地、生产镜像和公网文档状态一致。

P4 完成后只把 P5 恢复为“规划中,尚未实施”;不得自动启动主动工作循环。

十六、明确不包含

本 P4 不包含:

  • P5 定时唤醒。
  • P5 事件触发策略。
  • P5 全局主动循环、全局暂停或策略暂停。
  • P6 具体业务应用。
  • Codex 工程 Specialist。
  • 任意 Shell 或模型生成命令直接执行。
  • 自动 Git 提交。
  • 未经授权的自动生产部署。
  • 新 Provider Router。
  • OmniRoute 私有 Fork 或修改官方 OmniRoute 源码。
  • 新统一执行 Gateway。
  • Worker 获取 Cloudreve、Provider、Nomad、SSH、Docker 或系统动作凭据。
  • 声称 AI BOSS 无所不能。
  • 声称所有未来成果都能全自动验收。

十七、阶段关系

阶段五只有在本页第十五节全部通过、P4 新完成归档发布且生产开关稳定后,才保持为下一阶段规划入口。阶段五的职责是受 Benson 预先启用策略约束的定时和事件主动工作,不补做 P4 的智能编排或成果验收基础。阶段六至八继续按现有编号顺延,任何应用实现不得绕过 P4 与 P5 的阶段出口。