FIG. I · ADAPTORCH可供审查的执行记录
为审查 AI 变更的开发团队而设计

你的 AI 说它能跑。AdaptOrch 负责验证。

查看代理完成声明背后的执行记录,在一份报告中了解可用的验证结果和待审查事项。

托管服务支持提交任务和查看记录。代码检查需要单独配置执行环境。模型调用由您自己的供应商密钥单独计费。

运行报告说明性示例

AI 生成的说明性插图

了解“完成”背后的工作。

入口
您的代理 → 托管 MCP
模型
您选择的供应商和模型
代码检查
此示例中未运行
后续审查
检查输出,并按需配置检查。

报告布局示例,不是客户运行。任务完成与代码验证是不同事实。

打开报告示例 →
FIG. II · REVIEW THE RECORD说明性示例 · 独立验证环境

了解运行了什么,决定下一步审查什么。

从 PR 审查中已有的问题出发,将记录的输入、结果和后续工作联系起来。

  1. 01

    改动了什么?

    配置的验证路径记录了哪些文件和变更范围。

  2. 02

    检查了什么?

    实际执行的命令和目标,以及可用的变更前后结果。

  3. 03

    哪些通过、失败或未运行?

    区分完成、跳过和无法判定的检查。

  4. 04

    为什么需要审查?

    将发现的问题连接到文件、规则或执行记录。

  5. 05

    能否再次检查?

    根据记录的输入和环境信息准备再次检查。

  6. 06

    接下来做什么?

    由您审查未完成事项,或将具体上下文交回代理。

报告示例说明性示例,非客户数据
记录字段 · 示例值
变更3 个文件 · +41 / -4src/table.py+18 −4tests/test_io.py+19 −0config/prod.yaml+4 −0 · 超出声明范围
检查变更前复现检查FAIL变更后相同检查PASS部署环境集成检查未运行
规则发现 · 示例

配置文件在声明范围外发生变更,集成检查尚未运行。

AI 解释 · 说明性示例,非执行证据

确认配置变更是否属于此补丁,并决定需要进行哪些集成检查。

审查需要人工审查

实际报告仅涵盖执行过的检查,不保证未测试行为。本示例未运行客户代码。

技术边界correctness_claim: false
FIG. III · TWO WAYS TO START同一审查流程 · 不同执行边界

从记录开始。添加环境支持的检查。

可用的托管路径

连接代理,审查运行。

通过 MCP 或 API 提交模型任务,查看运行记录、输出和可用产物。Starter 是免费托管套餐。

  • 使用 AdaptOrch API 密钥认证。
  • 模型调用使用自己的供应商凭据。
  • 共享托管环境默认禁用命令验证。
开始免费托管使用

单独配置 / 范围明确的 PoC

在商定的执行环境中检查变更。

代码库和命令检查需要先明确环境、访问权限、检查命令及证据处理方式。升级托管套餐不会自动启用这些能力。

  • 明确访问、隔离和网络权限。
  • 审查检查结果及未分类的失败。
  • 商定配置、运行费用和评估标准。
咨询代码库验证

BYOK 是认证和计费安排,不表示代码不会离开设备。提交输入前请先阅读数据流说明。

数据、安全和运行责任 →

与你已经使用的工具并行工作

  • Cursor
  • Claude Code by Anthropic
  • GitHub
  • GitHub Actions
  • Docker

这些是兼容的工作流界面,标志不代表背书。

  • 连接到托管 API
  • 你的密钥自带密钥
  • 兼容现有编码代理
  • 原始数据已公开
FIG. II · TWO USERS one execution record

完成声明可能遗漏的四类问题。

检查变更范围、实际运行的检查、测试变更和执行环境失败。

工程团队

别再评审运行器噪声

在 CI 和评审时间被浪费之前,把安装、网络、运行器故障与真实代码故障分开。

查看执行轨迹 →
独立构建者

立即知道 AI 补丁是否可上线

无需读懂每一行代码,也能看到通过、需复核或阻止,并把凭据作为修复上下文交回编码代理。

PASS已在干净环境中运行 BLOCK需要处理并提供修复上下文
FIG. II-B · PRODUCT PREVIEW connect → run → receipt

从代理运行到可审查的记录。

在运行历史中查看状态、模型信息和可用产物。代码库检查需要单独配置执行路径。

  1. 01通过 MCP 或 API 连接已有代理。
  2. 02使用 BYOK 提交任务,或配置独立验证环境。
  3. 03审查记录和实际生成的检查结果。
查看说明性审查过程 →
AdaptOrch 运行历史界面示例
界面示例 · 说明性数据,非客户成果
了解配置后的验证方式环境 · 检查 · 保留的记录

明确独立执行环境的边界。

代码库检查取决于选定的环境和命令。运行前商定文件访问、网络权限和隔离方式。记录可用于与 CI 比较,但一个环境中的通过不保证另一个环境也通过。

临时工作空间与保留的报告是不同数据。工作空间按执行环境配置清理,运行记录、日志和产物遵循公布的保留政策。

执行与证据边界 →
FIG. IV · REVIEW QUESTIONS scope · checks · open items

完成报告可能遗漏的四个问题。

利用已有执行证据决定需要再次检查什么。这些是审查问题,不是每次运行都能检测所有问题的保证。

  1. #01“I FIXED IT”

    是否复现了错误?

    变更前后的复现有助于评估修复;若缺失,应注明其他证据和仍需测试的行为。

  2. #02“ONE FILE”

    范围是否变化?

    对照声明任务范围审查记录的文件与变更。配置的验证路径可帮助发现无关修改。

  3. #03“ALL GREEN”

    检查本身是否改变?

    删除或削弱测试可能改变通过结果的含义。请将测试变更与命令结果一起审查。

  4. #04“YOUR BUG”

    代码是否实际运行?

    分别审查配置、网络和测试结果。缺失命令与超时可被分类,模糊失败仍需诊断。

研究与测量资料 实验范围、原始数据、遗漏与限制

研究、方法与限制

结果仅适用于各自声明的实验范围。请同时查看正面结果、遗漏和方法限制;这不是对客户代码库性能的承诺。

基线 (A)
    验证路径 (C)
      30 项合成账本任务 · 每组运行一次 下载证据 JSON

      改善与退步的记录可在证据 JSON 中查看。

      每个方块是一项已记录的合成任务。绿色表示检查通过;红色边框表示 C 组相对 A 组退步的结果。

      30 项合成账本任务:paper 基线 A 与 robust + verifier C 相比,8 项改善,1 项退步。合成和验证设置都不同,因此并非仅验证器效果的对照实验。

      客户价值:证据能说明什么。

      本地执行已测量,人工时间节省尚未测量。请将这些结果与基于假设的成本估算分开看待。

      本地命令检查 · 已实测

      本实验使用可信的本地对照条件,测量 CommandVerifier 的创建、执行与分类耗时,没有调用模型 API。这并不是对实际 AI 生成补丁的验证。

      正在加载本地测量数据…

      下载全部尝试记录(JSON)→
      已记录尝试次数
      —
      固定对照条件数
      —
      每个条件的重复次数
      —
      分类不匹配的尝试次数
      —
      记录时间
      —
      源码修订版本
      —

      在本地重复执行五个固定的合成对照条件。重复次数不代表独立开发者或任务。匹配数是符合预期分类的次数,不是缺陷检测准确率。需要时可在表格内横向滚动;键盘用户可聚焦表格后使用方向键。

      本地对照结果与实际经过时间
      对照条件 预期分类 观测分类(次数) 中位数(毫秒) p95(毫秒) 匹配 / 尝试(次数)
      通过的断言分类不匹配 — — — — —
      失败的断言分类不匹配 — — — — —
      缺少可执行文件分类不匹配 — — — — —
      故意触发超时分类不匹配 — — — — —
      缺少 Python 依赖分类不匹配 — — — — —

      已知局限:缺少 Python 依赖被误分类为普通测试失败。分类器并不能将所有环境故障与候选代码故障区分开来。

      这些结果不是托管服务的往返延迟测量,不是安全隔离测试,也不是实际 AI 补丁验证。共享托管的命令验证默认关闭。命令组件既不复制项目,也不应用补丁。

      预先固定的协议与测量局限

      执行前已固定协议:每个对照条件重复 20 次,用种子 20260905 打乱顺序;每次尝试使用新的验证器,不使用缓存,执行一条命令,超时上限为 0.35 秒。

      固定对照条件共有五个:关于 2 + 2 的 Python 断言通过与失败、缺少可执行文件、原定 2 秒的休眠在 0.35 秒被终止,以及导入不存在的 Python 模块。这些简单测试输入并非 AI 生成补丁或真实项目测试套件;毫秒级耗时不代表真实项目测试延迟。

      可信测试输入在临时工作目录中运行,使用默认资源限制且不继承环境变量。临时目录不是项目的干净副本,也不是安全边界。

      使用单调时钟测量验证器创建、命令执行和分类的实际经过时间。不包括测量程序启动、报告序列化及网络延迟。

      保留所有尝试,包括较慢及出错的尝试。中位数与 nearest-rank p95 仅为描述性统计,不进行显著性检验、不估算可推广的准确率,也不作因果性的节省声明。

      JSON 记录源码修订版本、工作树变更状态、源码哈希和环境元数据。这是内部执行前协议,不是外部预注册或发布批准。

      人工时间节省 · 未测量

      这里没有人工评审研究或客户节省数据。本地命令耗时无法说明开发者节省了多少评审时间。

      在声称节省之前,必须在相同任务上配对测量手动与辅助工作流的实际评审活动时间,单独记录等待时间,独立核验正确性,并记录真实的订阅、服务商、基础设施、设置及维护成本。应纳入独立开发者与代码仓库,随机安排工作流顺序,并保留失败或更慢的运行。

      FIG. V · MEASURED EVIDENCE measured run + scenario estimate

      一次实测运行。

      paired_confirmatory_ledger:30 项合成账本任务,一次配对会话。基线 86.7%,验证后 100.0%,差值 +13.3pp(95% CI +3.3 至 +26.7)。合计判定未达显著,族门未通过:方向性结果,而非已证实。它与A/C 账本是不同实验。

      实测配对运行:30 个台账任务,基线 86.7%,验证后 100.0%,配对差值 +13.3pp,95% CI +3.3 至 +26.7。合计配对判定未达显著,族门未通过,故应视为方向性结果而非已证实的结论。三个任务族中两个已被基线饱和。模型 gemma-4-31b,Cerebras,确定性种子。
      图板 00 · 实测 — 配对验证 · 打开原图 ↗
      FIG. VI · THE MAJORITY TRAP 20 puzzles · three models

      更多模型。本次结果却更差。

      本次 20 道 ARC-AGI-2 题实验中,最强单模型答对 14/20,精确答案投票答对 10/20,且费用更高。这是一次内部实验,不是普遍结论。

      • 01最强单模型:20 项中答对 14 项
      • 02精确答案投票:20 项中答对 10 项
      • 03一致意见本身不代表正确

      公开汇总包括错误与截断数。GPT 评分 16 项、错误 4 项;Qwen 评分 19 项、截断 1 项。评分分母与最强单模型及投票组不同。

      查看汇总证据 JSON

      ARC-AGI-2 · 20 PUZZLES2026-08-26
      BEST ONE claude-opus-4-814 / 20 记录费用$16.91
      THE REST qwen3.7-max9 / 19 gpt-5.6-luna6 / 16
      ALL THREE majority vote10 / 20 记录费用$29.00
      VERDICT 费用更高,分数更低。

      记录中的模型调用成本(USD),为三个成员组费用之和。不是客户账单或完整 TCO;该记录未确认额外收费。

      three-way-20260826T142538Z

      公开数据是汇总而非逐题配对结果,无法独立确定改善和退步各有多少项。

      n = 20 · 描述性汇总比较,不是通用性能声明。

      说明性交互示例,此按钮不会运行客户代码或调用模型。

      FIG. VII · PATCH INSPECTOR interactive example · apply → classify → review

      查看说明性审查过程。

      选择场景并回放展示步骤。演示使用固定示例数据。

      AI 做了什么 Candidate patch modifies astropy/table.py to repair issue behavior.
      1. 跑一遍Docker harness apply: pass
      2. 列出改动Realized git diff generated
      3. 检查Flagged: repaired, but never reproduced
      结论 Needs Review

      The patch applies cleanly, but we cannot call it correct. The test evidence came back inconclusive, and the shadow check flagged repair risk with no reproducible run behind it.

      FIG. VIII · PACKAGING shadow evidence → PR preflight

      选择审查工作所需的使用容量。

      以下三种均为托管服务套餐。从查看记录开始,选择合适的运行额度和工作区用户数量。

      所有套餐的模型执行均需自带密钥(BYOK)。订阅包含列出的服务额度,模型费用由供应商另行收取。AdaptOrch 密钥用于服务认证,不是模型供应商密钥。

      可选的集合运行在已配置任务中调用您自己的 2–5 个模型。一次接收的运行使用一个套餐额度,供应商分别收取每个成员的令牌费用。费用取决于模型、令牌和尝试次数。工作区用户是人员而非模型成员,一致率不是准确性保证。

      模型输出和 AI 解释属于 AI 生成内容,需要人工审查。不要将其等同于执行日志或实际运行的检查结果。

      方案 定位 月付 包含 操作
      01入门版 连接并查看首批记录 $0/month 托管 API 访问 · 自有供应商密钥 每月 5,000 次已接收运行 · 1 位工作区用户 运行记录和可用产物 免费开始 →
      03团队版 在共享工作区审查记录 $149/month 每月 250,000 次已接收运行 · 15 位工作区用户 更大的共享工作区容量 配置的仪表盘访问范围 咨询独立代码库验证范围 选择团队版 →
      04独立执行环境 / PoC 代码库验证 · 独立环境 面议按合同 可行性确认后商定评估周期 讨论起点:1–3 个代码库 · 30–100 个候选变更 案例报告与未分类失败 比较有效发现与运行投入 咨询 PoC →

      年度金额为 USD 全年账单,不是月度扣款。Pro 每年 $421.20(月均 $35.10);Team 每年 $1,609.20(月均 $134.10)。Starter 不享受年度折扣。

      托管套餐不会自动应用或合并代码库变更。单独配置的检查可在商定工作区中应用候选变更,人工审查和实际执行范围始终明确。

      什么算一次运行?

      月度额度计算已接收的运行,不计算状态或产物查询。额度在接收时而非 SUCCEEDED 时使用。内部尝试属于同一运行,单独接收的重跑再次计数。供应商的令牌费用另计。

      什么需要单独配置?

      代码库命令检查需要单独配置执行环境。升级 Pro 或 Team 不会自动启用托管命令验证;配置和执行环境费用另行商定。

      估算每月收支平衡点 基于你的假设 · 非实测节省

      要达到收支平衡,需要改变什么?

      经济性 · 仅为估算。根据你自己的人工价值和成本假设,比较按月付费的托管订阅与自托管。节省效果尚未测量。

      你的每月成本假设

      仅填写相对于自托管基线增加的服务商支出。如果没有,请明确输入 0;留空不代表零。

      这些字段仅保留在浏览器中。此计算器不会提交或保存输入值。

      所需减少量,而非已节省时间

      正在加载当前月度方案价格…

      每月订阅费(USD)
      —
      每月所需人工时间减少量(分钟)
      —

      max(0, subscription + extra_provider - self_host_infra) / hourly * 60

      subscription、extra_provider 和 self_host_infra 分别为每月订阅费、额外服务商支出和自托管基础设施成本(USD);hourly 为每小时人工价值(USD)。结果以每月分钟数表示,下限为零。

      这是根据输入条件达到收支平衡所需的每月人工时间减少量,不是实测节省时间,也不是完整 TCO。我们不会按小时数或 PR 数量推荐方案。

      使用当前每月 USD 价格,而非年度促销价。不包括税费及两种工作流共同承担的 BYOK 成本。初始设置和持续维护并未全部计入,实际总成本可能不同。

      FIG. X · WHAT WE DON’T CLAIM the honest part

      我们无法证明你的代码是对的。

      检查通过只覆盖实际执行的条件,不代表整体正确性、安全性或未测试条件下的行为已经得到证明。

      运行凭据展示已记录的证据。未执行验证的运行不等于测试通过。上面的本地实验测量命令检查,不能证明托管补丁执行或开发者节省了时间。

      我们也公开不利结果。合成账本 A/C 对比中,8 项改善、1 项退步。这同时比较了合成和验证设置,并非仅验证器的效果。

      阅读正式的主张边界

      FIG. XI · FAQ claim boundaries first

      大家真正会问的问题。

      如果这个页面上有任何承诺超出了我们能展示的证据,告诉我们,我们会改页面。

      Q.01现在可以使用哪些托管功能?

      通过 MCP 或 API 提交模型任务,查看记录、输出和可用产物。共享托管命令验证默认禁用;代码库检查需要独立执行环境。

      Q.02你们能证明我的代码是对的吗?

      我们不提供代码整体正确性的证明。请核对实际执行了哪些验证、记录了哪些证据。没有执行测试的模型运行成功,不等于测试通过。

      Q.03它会改变我的 AI 的行为吗?

      默认托管流程不会自动应用或合并客户代码库中的变更。独立配置的验证环境可在商定的工作区中应用候选变更以供检查;审查决定仍由客户负责。

      Q.04一次检查要多久?

      当前表格展示五种固定对照输入的本地命令检查耗时。历史台账实验测量的是另一种操作。两者都不能证明你的仓库延迟、托管端到端延迟或开发者节省的时间。

      Q.05如果是我的机器坏了导致测试失败呢?

      本地对照实验区分了缺失可执行文件与超时,但缺失 Python 依赖被归为普通测试失败。失败标签需要结合上下文,不能保证诊断所有环境问题。

      Q.06月度额度计算什么?

      一次接收的运行使用一个额度。状态、用量和产物查询不会创建新运行。完成不是计数触发点,单独接收的重跑再次计数;供应商令牌费另计。

      Q.07模型输出和测试结果是相同证据吗?

      不是。模型可能在没有代码检查的情况下完成。请查看实际命令、结果及跳过或未测试部分;AI 解释不能代替这些记录。

      Q.08它支持 Claude Code、Cursor 或 Codex 吗?

      使用适合客户端的文档化 MCP 或 HTTP 连接方式。认证、模型执行和代码库验证是不同步骤,需要分别确认。

      Q.09凭据上到底有什么?

      报告展示执行记录及可用验证证据。变更文件、前后测试和重跑信息取决于配置路径;缺失的检查必须保持明确。

      Q.10我可以在自己的机器上运行吗?

      公开 Starter 连接托管 AdaptOrch。在本机运行客户端不等于自托管服务。如需内网部署,请咨询单独的私有运行器选项。

      Q.11我的私有代码安全吗?

      托管请求经过 AdaptOrch 和你配置的 AI 服务商。提交私有代码前请查看数据传输和保留政策。私有运行器是单独部署,并非 Starter 默认配置。

      Q.12它什么时候会自己拦下一次错误合并?

      默认托管服务不包含自动合并。任何主动阻断策略都需根据客户环境和审查政策单独配置及评估。

      FIG. XII · BOOK DEMO audit first · merge later
      代码库验证 PoC

      提出审查问题。商定有用的评估。

      说明需要验证的问题。先确认执行限制,再在代码库工作前商定范围、交付物和价格。

      • 保留已有编码工具
      • 商定代码库与执行范围
      • 从报告开始,不自动合并
      • 同时审查有效发现、遗漏和配置成本
      • 免费托管 Starter 是独立的自助路径
      申请范围明确的 PoC

      请勿提交源代码、API 密钥或客户数据。此咨询不会执行任务。

      更喜欢邮件? ingeng2004@gmail.com

      登录