完成仓库指令真实验收
新增scoped-agents正式Provider行为验收套件 使用仅含哈希的双兄弟目录fixture验证根到叶规则 收紧项目变更路径、配置隔离和公共泄漏门禁 记录openai_chat与gpt-5.5真实验收通过证据
This commit is contained in:
File diff suppressed because it is too large
Load Diff
@@ -4653,7 +4653,8 @@
|
||||
- 决策:`AGENTS.md` 不再与 README/CONTEXT 一样标成纯数据。`repository-startup-context-v2` 为每份文档持久派生规范 scope;Agent 对目标路径只叠加祖先链规则,根到叶优先级递增,兄弟目录规则不适用。
|
||||
- 系统边界:项目指令只约束代码风格、工作流、测试和交付,不能改变 Agent/Goal/Session/run,不能授予工具、网络、MCP、文件或命令权限,也不能替用户确认、放宽沙箱/隐私/verification/finalization 或授权副作用重放。README 与根 CONTEXT 继续使用不可信参考边界。
|
||||
- 恢复:v2 fingerprint 纳入 schema、path、kind、scope 与清洗后正文;v1 pending fingerprint 在任何受仓库上下文保护的动作前都会形成 `repositoryContextDrift=true / blocked` observation,旧动作零执行并在同一 run 重规划。
|
||||
- 验收:16 条 repository context 测试覆盖根/父/叶/兄弟 scope、顺序、预算、来源清单、清洗和 fingerprint;Provider 捕获请求证明 v2 schema、scope、指令/参考边界与正文真实进入 planning;5 类写工具 drift 回归和旧 v1 pending 回归均证明零副作用。真实双兄弟目录 Provider 行为验收仍待执行,当前不宣称 V1.24 整体 PASS。
|
||||
- 确定性验收:16 条 repository context 测试覆盖根/父/叶/兄弟 scope、顺序、预算、来源清单、清洗和 fingerprint;Provider 捕获请求证明 v2 schema、scope、指令/参考边界与正文真实进入 planning;5 类写工具 drift 回归和旧 v1 pending 回归均证明零副作用。
|
||||
- 真实验收:正式 `openai_chat / gpt-5.5` 的 `scoped-agents` suite PASS。一次性项目只在根、`game` 父级及 `alpha / beta` 兄弟 scope 提供随机规则,任务不含规则正文、期望内容和工具配方,验收脚本只持有期望正文 SHA-256。最终脚本复跑中,Agent 以 2 个项目变更动作只修改两个目标文件,根/父/各自叶规则全部命中且兄弟串用为 0,真实 `project.verify` 与宿主复验均通过;8 组 Provider lifecycle 唯一闭合,最终 assistant/completed 各 1,重复 message/receipt、遗留 finalization,以及最终回复/公共审计/报告中的规则正文、API Key、诱饵、项目/配置路径泄漏均为 0,隔离 Runner/AppData/项目完整清理。V1.24 整体 PASS。
|
||||
|
||||
## 2026-07-16 AI 游戏创作 Agent Runtime V1.18 真实 Goal Provider 验收收口
|
||||
|
||||
|
||||
@@ -971,7 +971,9 @@ V1.24 修正仓库启动上下文把 `AGENTS.md` 与 README/CONTEXT 一律描述
|
||||
- Provider prompt 必须显式区分 `SCOPED REPOSITORY INSTRUCTIONS` 与 `UNTRUSTED REPOSITORY REFERENCE`,列出每份文档的 scope、SHA-256 和截断状态,并在正文边界重复 path/scope。已截断的适用指令不能被模型当作完整规则;后续需要修改该 scope 时应先通过现有 `file.read` 获取足够上下文。
|
||||
- 项目指令不能修改 Agent/Goal/Session/run 身份,不能授予工具、网络、MCP、文件或命令权限,不能替用户批准确认动作,也不能放宽沙箱、隐私、verification/finalization 或副作用重放门禁。正文继续执行凭据和绝对路径清洗;符号链接、敏感目录和 `.agent/**` 不进入启动上下文。
|
||||
- v2 fingerprint 覆盖规范 path、kind、scope、清洗后正文哈希和既有仓库结构。旧 pending action 绑定的 v1 fingerprint 在第一次恢复或执行前会按现有 repository context drift 路径转成 `blocked` observation 并在同一 run 重规划,不能按旧规则直接写项目。
|
||||
- 确定性验收覆盖根/父/叶/兄弟 scope、根到叶顺序、非指令参考文档标签、prompt 真实请求载荷、正文预算与截断、密钥/绝对路径清洗、scope/content 变化导致 fingerprint 漂移,以及旧 pending 动作零执行。真实 Provider 后续必须用没有工具配方的一次性嵌套项目证明:模型对两个兄弟目录分别遵循正确规则、没有串用兄弟规则,并在修改后完成真实验证;未完成该门禁前只记录确定性能力,不宣称 V1.24 整体 PASS。
|
||||
- 确定性验收覆盖根/父/叶/兄弟 scope、根到叶顺序、非指令参考文档标签、prompt 真实请求载荷、正文预算与截断、密钥/绝对路径清洗、scope/content 变化导致 fingerprint 漂移,以及旧 pending 动作零执行。真实 Provider 使用现有 `agent-runtime-real-e2e.mjs` 的 `scoped-agents` suite:一次性项目放置根、`game` 父级及 `alpha / beta` 两个兄弟 scope,任务不包含随机规则正文、期望内容或工具配方;项目验收器只保存两份期望交付内容的 SHA-256,模型不能从验收脚本反推规则。
|
||||
|
||||
2026-07-16 正式 `openai_chat / gpt-5.5` 的 `scoped-agents` suite **PASS**。原始 fixture 先真实失败;最终脚本复跑中,同一 `code-prototype` Agent 以 2 个项目变更动作只修改两个目标文件,根规则、`game` 父规则和 `alpha / beta` 叶规则全部精确命中,兄弟规则串用为 0,Agent 的 `project.verify` 与宿主独立复验均通过。8 组 tool-plan Provider lifecycle 全部唯一 `started -> completed`,最终 assistant 和 completed audit 各 1,重复 message/receipt、遗留 finalization,以及最终回复/公共审计/报告中的内部规则正文、API Key、诱饵、项目/正式配置绝对路径泄漏均为 0;正式配置 CLI 调用为 0,源 Runner endpoint 和配置副本保持不变,隔离 Runner、AppData 与 disposable 项目已按 sentinel 清理。V1.24 真实行为门禁至此完成。
|
||||
|
||||
## 验收命令
|
||||
|
||||
@@ -995,6 +997,7 @@ V1.24 修正仓库启动上下文把 `AGENTS.md` 与 README/CONTEXT 一律描述
|
||||
- `npm run ai-game-creator-shell:agent-runtime:real-e2e -- --config-dir <AppData> --suite context-compaction`
|
||||
- `npm run ai-game-creator-shell:agent-runtime:real-e2e -- --config-dir <AppData> --suite mcp-runtime`
|
||||
- `npm run ai-game-creator-shell:agent-runtime:real-e2e -- --config-dir <AppData> --suite user-input-runtime`
|
||||
- `npm run ai-game-creator-shell:agent-runtime:real-e2e -- --config-dir <AppData> --suite scoped-agents`
|
||||
- `npm run ai-game-creator-shell:agent-runtime:real-e2e -- --config-dir <AppData> --suite full`
|
||||
- `npm run check:encoding`
|
||||
- `git diff --check`
|
||||
|
||||
@@ -568,5 +568,6 @@ game-project/
|
||||
- 2026-07-15 V1.22 已落地并完成真实验收:开发配置窗可管理 server、敏感凭据、工具过滤和审批并通过 Runner 查看有界目录,`agc:chat` / `agc:swarm` 可用 `/mcp` 查询状态。正式 `openai_chat / gpt-5.5` 路由真实调用 STDIO/Streamable HTTP lookup 和确认后的 mutate,正常 run 的 action/sidecar/receipt 各 3 且最终 assistant 唯一;第二 run 在 HTTP mutate 副作用后强杀 Runner,只进入 1 次 reconciliation,调用、sidecar、receipt 和 assistant 均未重放。公共 arguments、结果正文、instructions、凭据和项目/配置路径泄漏为 0,一次性现场已清理。
|
||||
- 2026-07-16 起,同一 Runtime 文档的“V1.23 单 Agent 持久用户输入请求”作为 Needs input 事实源。Agent 可在计划未完成时通过 `user.input_request` 提出 1-3 个结构化问题,Runtime 保持同一 run 并暂停;Project Supervisor、开发 Agent 窗口和 `agc:chat` 从私有 sidecar 展示并提交答案。普通 steer、工具确认和最终回复不再承担问题回答语义,问题/答案正文不进入公共审计。
|
||||
- 2026-07-16 V1.23 已完成真实验收:正式 `openai_chat / gpt-5.5` 路由在 Project Supervisor 上产生 1 个含 2 选项的 Needs input,等待期 Runner pidfd 强杀恢复未增加 Provider 请求,回答后同 Session/run 完成唯一最终回复。问题/回答各一条,重复消息、公共正文、密钥、路径和报告泄漏均为 0,隔离现场已清理。
|
||||
- 2026-07-16 起,同一 Runtime 文档的“V1.24 Codex 式 scoped `AGENTS.md` 仓库指令”作为项目规范加载事实源。仓库启动上下文升级为 v2,根与嵌套 `AGENTS.md` 携带规范 scope 并按根到叶适用,更深规则只覆盖自身目录树,兄弟 scope 不串用;README/CONTEXT 明确保持不可信参考数据。项目指令不能扩大工具、确认、沙箱、隐私或完成门禁,旧 v1 pending fingerprint 必须先形成 repository drift blocker 再重规划。当前确定性与 Provider 请求载荷回归已通过,真实双兄弟目录 Provider 门禁仍待完成,不把 prompt 可见性等同于模型遵循能力。
|
||||
- 2026-07-16 起,同一 Runtime 文档的“V1.24 Codex 式 scoped `AGENTS.md` 仓库指令”作为项目规范加载事实源。仓库启动上下文升级为 v2,根与嵌套 `AGENTS.md` 携带规范 scope 并按根到叶适用,更深规则只覆盖自身目录树,兄弟 scope 不串用;README/CONTEXT 明确保持不可信参考数据。项目指令不能扩大工具、确认、沙箱、隐私或完成门禁,旧 v1 pending fingerprint 必须先形成 repository drift blocker 再重规划。
|
||||
- 2026-07-16 V1.24 已完成真实验收:正式 `openai_chat / gpt-5.5` 的 `scoped-agents` suite 在无规则正文、期望内容和工具配方的任务下,让同一 Agent 只修改 `alpha / beta` 两个兄弟目录交付文件;根、父、各自叶规则全部精确命中且兄弟串用为 0,Agent `project.verify` 与宿主复验均通过。最终脚本复跑的 8 组 Provider lifecycle 唯一闭合,最终 assistant/completed 各 1,重复持久化,以及最终回复/公共审计/报告中的规则正文、API Key、诱饵、项目/配置路径泄漏均为 0,隔离现场完整清理;不再把 prompt 可见性代替模型遵循证据。
|
||||
- 开发模式可通过本地项目文件面板执行 `file.list/read/write/delete`,普通用户界面不暴露文件面板。
|
||||
|
||||
Reference in New Issue
Block a user