WORKBENCH / 一次完整的开发流程
一个 Agent 开发任务,实际是怎么跑完的。
点一个阶段,看看这一步里人和 Agent 各自做了什么。
Agent Workbench
一次真实工程任务,如何从一句意图走到可发布证据。
把“做个智能审批”压成可验收目标
先约束业务结果、人工边界和失败条件。Agent 得到的不是一句愿望,而是一组可以被证伪的工程假设。
- 营销审批 P50 从 11 小时降到 4 小时内
- 高风险决策必须保留人工确认
- 每次建议都能回放上下文与依据
只给模型刚好够用的上下文
将领域规则、真实样本和模块边界装进可版本化的 context pack,避免把整座代码仓库倾倒进窗口。
- 抽取 12 条审批规则与 8 个边界案例
- 标注禁止修改的订单与权限模块
- 关联 ADR、接口契约和失败日志
拆成能独立验证、随时回滚的切片
计划不按技术层横切,而是让每一步都穿过接口、领域逻辑和测试,尽早暴露集成风险。
- Slice 01:只读建议,不写入业务状态
- Slice 02:人工确认后生成审批动作
- Slice 03:灰度开启自动补全低风险字段
让 Agent 写实现,人守住模块边界
Agent 在明确接口内循环编码、运行测试并提交小步 diff;工程师只在架构偏航和证据不足时介入。
- 新增 AdvisorPort,不反向依赖流程引擎
- 失败路径返回可解释的 reason code
- 单次变更控制在 220 行以内
用运行证据收口,而不是“看起来能跑”
构建结果必须同时通过契约、回归、越权和业务指标检查;每条结论都能跳回产生它的测试或追踪记录。
- 契约与回归用例 46 / 46 通过
- 越权写入与提示注入均被拦截
- 影子流量下 P95 延迟为 238 ms
WRITING / 精选文章
全部文章 ↗Deep Dive / 2026.07.25
OpenHarness 源码阅读(五):Hooks
拆开 OpenHarness Hooks:生命周期事件何时触发、哪些 blocked 真能阻止主流程,以及审计、外部策略与 compact 上下文保留该放在哪里。
Deep Dive / 9 MIN
OpenHarness 源码阅读(四):Permissions
One gate, three modes, a fixed order.
Deep Dive / 10 MIN
OpenHarness 源码阅读(三):Tools
From schema to governed execution.
Deep Dive / 13 MIN
OpenHarness 源码阅读(二):Engine 生命周期
Inside run_query(), from input to stop.
Deep Dive / 7 MIN
OpenHarness 源码阅读(一):Query Loop
Trace one message through the agent harness.
PROJECTS / 做过的系统
全部项目 ↗OpenHarness Lab
Source Reading / Modification
2026
RESEARCH以一套边界集中的 Agent Harness 为样本,阅读主循环、工具、权限与上下文,逐步建立自己的 Agent 运行时。
Open Source / Runtime / Tool Use企业流程平台 · Agent 入口
Platform Engineering
NOW
BUILDING把流程生成、配置解释、异常诊断和操作建议变成可验证的 Agent 能力,同时保留确定性系统的控制边界。
Workflow / Agent Runtime / Java大营销抽奖平台
Backend Architecture
2024
SHIPPED围绕高并发库存、幂等、消息补偿和活动编排构建可靠的营销基础设施,并把真实故障经验沉淀为实验。
Distributed Systems / Reliability / Java