文档:纳入 platform-llm 本地解析测试统计
将当前确定性测试统计更新为 98 项通过 补充 integration test 中 3 个 parse_api_kind 测试的统计归属 明确真实 Provider smoke 仍为 1 项 ignored
This commit is contained in:
@@ -5542,6 +5542,6 @@
|
||||
|
||||
## 2026-07-27 校正 platform-llm 流式工具验收证据边界
|
||||
|
||||
- 更正:上一条把固定 SSE fixture 的真实抓包来源、确定性 parser 覆盖和真实端点 smoke 合并描述,并写成“证明转录没有偏差”,超出了实际测试证据。从仓库根目录运行 `cargo test --manifest-path server-rs/Cargo.toml -p platform-llm` 当前为 `84 passed / 0 failed / 1 ignored`;其中固定 fixture 只验证 parser 归一结果,实时测试只验证最终归一后的工具名、id、完整参数 JSON 和文本增量字符数。
|
||||
- 更正:上一条把固定 SSE fixture 的真实抓包来源、确定性 parser 覆盖和真实端点 smoke 合并描述,并写成“证明转录没有偏差”,超出了实际测试证据。从仓库根目录运行 `cargo test --manifest-path server-rs/Cargo.toml -p platform-llm` 当前为 `98 passed / 0 failed / 1 ignored`;其中固定 fixture 和本地解析测试只验证 parser / 配置归一结果,实时测试只验证最终归一后的工具名、id、完整参数 JSON 和文本增量字符数。
|
||||
- 当前口径:`server-rs/crates/platform-llm/tests/live_stream_tool_calls.rs` 是默认忽略的真实端点工具调用 smoke;`on_delta` 只接收文本,工具调用从最终 `LlmRunResponse.tool_calls` 读取。现有测试没有原始 SSE 录制、事件类型/slot/分片顺序保存或逐事件比较,因此两类测试都不能证明 raw SSE fidelity 或抓包转录无偏差。
|
||||
- 现有确定性流式工具覆盖应与普通 Anthropic 文本流测试分开统计:三协议真实来源 fixture、Responses completed-only 恢复、并行 slot 聚合、截断参数和无片段 `StreamUnavailable` 等用例共同覆盖 parser 边界;未来若需证明转录一致性,必须另行增加受控原始 SSE capture/compare 能力。
|
||||
|
||||
Reference in New Issue
Block a user