evaluated — 用真实交付记录做离线复盘
可选入口: 只帮你评估和改进工作流,单独跑完不算验收通过;验收仍看 ralph / dispatch 的记录。把真实项目的对话导出、Git、交接、验证和任务工件整理成可回放的 episode,分析耗时、返工和流程问题,再由人决定是否改进 skill。
写法
| 工具 | 写法 |
|---|---|
| Codex | $jj-evaluated … |
| Claude / Grok / Qoder | /jj-evaluated … |
适用与边界
用得当:
- 复盘项目A → 项目B 的迁移成本、返工或交接复用
- 比较策略,找出可泛化的流程改进
- 把 episode 验证、拆分、回归结果留档
别用在: 只是想做当前需求用 ralph;想推进多项目交付用 dispatch。它是实验性离线评估,不是实时调度器。
开始前
- 准备真实的对话导出或 JSON/JSONL episode,以及可核对的 Git / 任务工件;证据不足时不会自行编造
- 明确评估哪些项目、角色和时间范围;不同项目仍保持项目A / 项目B / 项目C 的角色区分
- 先确认隐私边界;未经明确授权,不把原始对话发到外部服务
第一次这样用
你说:
text
$jj-evaluated 对最近一次 项目A→项目B handoff 做时长与复用诊断Agent 会做:
- 确定范围和证据来源,先校验 episode 格式
- 计算带来源和质量说明的基线,再做不泄漏 holdout 的拆分检查
- 针对一个明确问题提出一个有界候选,先做轻量回放、再按需做更重的回归
- 把结果和风险写入报告,等你明确决定"推广"或"归档";没有人工批准不会改生产 skill
你会看到:
text
episode:已校验
基线:时长 / 等待 / 返工(均带来源说明)
候选:1 个,等待人工复核
报告:.workflow/evaluated/…/report.md怎样算做完: 报告包含证据、拆分、回放、回归和人工决定;绿色分数本身不能自动推广候选。
常用说法
text
$jj-evaluated validate episode.json
$jj-evaluated 对项目A、项目B 最近一轮交付做返工诊断
$jj-evaluated 离线评估:禁止自动 promote,只出 report做完之后
| 你想做什么 | 下一步 |
|---|---|
| 认可改进候选 | 明确批准后,按报告把它写入版本化 skill / 规格 |
| 暂不推广 | 归档报告,保留回归资料 |
| 缺数据 | 按报告的补采样建议行动,不要估算 |
| 继续做业务改动 | 回到 ralph 或 same |
边界细则
最小 runner 在 skills/jj-evaluated/scripts/:episode-validate.mjs 校验格式;evaluated_ops.mjs 提供 validate、init-report、check-split 和确定性回归。评估报告不是控制面的事实来源,不能推进任何交付 checkpoint。
记录在哪
text
.workflow/evaluated/<episode-id>/
report.md