可用的托管路径
连接代理,审查运行。
通过 MCP 或 API 提交模型任务,查看运行记录、输出和可用产物。Starter 是免费托管套餐。
- 使用 AdaptOrch API 密钥认证。
- 模型调用使用自己的供应商凭据。
- 共享托管环境默认禁用命令验证。
查看代理完成声明背后的执行记录,在一份报告中了解可用的验证结果和待审查事项。
托管服务支持提交任务和查看记录。代码检查需要单独配置执行环境。模型调用由您自己的供应商密钥单独计费。
AI 生成的说明性插图
报告布局示例,不是客户运行。任务完成与代码验证是不同事实。
打开报告示例 →从 PR 审查中已有的问题出发,将记录的输入、结果和后续工作联系起来。
配置的验证路径记录了哪些文件和变更范围。
实际执行的命令和目标,以及可用的变更前后结果。
区分完成、跳过和无法判定的检查。
将发现的问题连接到文件、规则或执行记录。
根据记录的输入和环境信息准备再次检查。
由您审查未完成事项,或将具体上下文交回代理。
src/table.py+18 −4tests/test_io.py+19 −0config/prod.yaml+4 −0 · 超出声明范围配置文件在声明范围外发生变更,集成检查尚未运行。
确认配置变更是否属于此补丁,并决定需要进行哪些集成检查。
实际报告仅涵盖执行过的检查,不保证未测试行为。本示例未运行客户代码。
correctness_claim: false可用的托管路径
通过 MCP 或 API 提交模型任务,查看运行记录、输出和可用产物。Starter 是免费托管套餐。
单独配置 / 范围明确的 PoC
代码库和命令检查需要先明确环境、访问权限、检查命令及证据处理方式。升级托管套餐不会自动启用这些能力。
BYOK 是认证和计费安排,不表示代码不会离开设备。提交输入前请先阅读数据流说明。
数据、安全和运行责任 →与你已经使用的工具并行工作
这些是兼容的工作流界面,标志不代表背书。
检查变更范围、实际运行的检查、测试变更和执行环境失败。
在 CI 和评审时间被浪费之前,把安装、网络、运行器故障与真实代码故障分开。
查看执行轨迹 →无需读懂每一行代码,也能看到通过、需复核或阻止,并把凭据作为修复上下文交回编码代理。
在运行历史中查看状态、模型信息和可用产物。代码库检查需要单独配置执行路径。
代码库检查取决于选定的环境和命令。运行前商定文件访问、网络权限和隔离方式。记录可用于与 CI 比较,但一个环境中的通过不保证另一个环境也通过。
临时工作空间与保留的报告是不同数据。工作空间按执行环境配置清理,运行记录、日志和产物遵循公布的保留政策。
执行与证据边界 →利用已有执行证据决定需要再次检查什么。这些是审查问题,不是每次运行都能检测所有问题的保证。
变更前后的复现有助于评估修复;若缺失,应注明其他证据和仍需测试的行为。
对照声明任务范围审查记录的文件与变更。配置的验证路径可帮助发现无关修改。
删除或削弱测试可能改变通过结果的含义。请将测试变更与命令结果一起审查。
分别审查配置、网络和测试结果。缺失命令与超时可被分类,模糊失败仍需诊断。
结果仅适用于各自声明的实验范围。请同时查看正面结果、遗漏和方法限制;这不是对客户代码库性能的承诺。
改善与退步的记录可在证据 JSON 中查看。
每个方块是一项已记录的合成任务。绿色表示检查通过;红色边框表示 C 组相对 A 组退步的结果。
30 项合成账本任务:paper 基线 A 与 robust + verifier C 相比,8 项改善,1 项退步。合成和验证设置都不同,因此并非仅验证器效果的对照实验。
本地执行已测量,人工时间节省尚未测量。请将这些结果与基于假设的成本估算分开看待。
本实验使用可信的本地对照条件,测量 CommandVerifier 的创建、执行与分类耗时,没有调用模型 API。这并不是对实际 AI 生成补丁的验证。
正在加载本地测量数据…
本地数据已加载。下方显示所有结果,包括不匹配项。
无法加载测量数据,暂不显示任何结果。请下载 JSON 直接检查。
在本地重复执行五个固定的合成对照条件。重复次数不代表独立开发者或任务。匹配数是符合预期分类的次数,不是缺陷检测准确率。需要时可在表格内横向滚动;键盘用户可聚焦表格后使用方向键。
| 对照条件 | 预期分类 | 观测分类(次数) | 中位数(毫秒) | p95(毫秒) | 匹配 / 尝试(次数) |
|---|---|---|---|---|---|
| 通过的断言分类不匹配 | — | — | — | — | — |
| 失败的断言分类不匹配 | — | — | — | — | — |
| 缺少可执行文件分类不匹配 | — | — | — | — | — |
| 故意触发超时分类不匹配 | — | — | — | — | — |
| 缺少 Python 依赖分类不匹配 | — | — | — | — | — |
分类不匹配:缺少依赖的对照条件预期为 ENV_ERROR,实际观测为 FAIL。不匹配的尝试仍保留在耗时汇总与可下载数据中。
已知局限:缺少 Python 依赖被误分类为普通测试失败。分类器并不能将所有环境故障与候选代码故障区分开来。
这些结果不是托管服务的往返延迟测量,不是安全隔离测试,也不是实际 AI 补丁验证。共享托管的命令验证默认关闭。命令组件既不复制项目,也不应用补丁。
执行前已固定协议:每个对照条件重复 20 次,用种子 20260905 打乱顺序;每次尝试使用新的验证器,不使用缓存,执行一条命令,超时上限为 0.35 秒。
固定对照条件共有五个:关于 2 + 2 的 Python 断言通过与失败、缺少可执行文件、原定 2 秒的休眠在 0.35 秒被终止,以及导入不存在的 Python 模块。这些简单测试输入并非 AI 生成补丁或真实项目测试套件;毫秒级耗时不代表真实项目测试延迟。
可信测试输入在临时工作目录中运行,使用默认资源限制且不继承环境变量。临时目录不是项目的干净副本,也不是安全边界。
使用单调时钟测量验证器创建、命令执行和分类的实际经过时间。不包括测量程序启动、报告序列化及网络延迟。
保留所有尝试,包括较慢及出错的尝试。中位数与 nearest-rank p95 仅为描述性统计,不进行显著性检验、不估算可推广的准确率,也不作因果性的节省声明。
JSON 记录源码修订版本、工作树变更状态、源码哈希和环境元数据。这是内部执行前协议,不是外部预注册或发布批准。
这里没有人工评审研究或客户节省数据。本地命令耗时无法说明开发者节省了多少评审时间。
在声称节省之前,必须在相同任务上配对测量手动与辅助工作流的实际评审活动时间,单独记录等待时间,独立核验正确性,并记录真实的订阅、服务商、基础设施、设置及维护成本。应纳入独立开发者与代码仓库,随机安排工作流顺序,并保留失败或更慢的运行。
paired_confirmatory_ledger:30 项合成账本任务,一次配对会话。基线 86.7%,验证后 100.0%,差值 +13.3pp(95% CI +3.3 至 +26.7)。合计判定未达显著,族门未通过:方向性结果,而非已证实。它与A/C 账本是不同实验。
本次 20 道 ARC-AGI-2 题实验中,最强单模型答对 14/20,精确答案投票答对 10/20,且费用更高。这是一次内部实验,不是普遍结论。
公开汇总包括错误与截断数。GPT 评分 16 项、错误 4 项;Qwen 评分 19 项、截断 1 项。评分分母与最强单模型及投票组不同。
记录中的模型调用成本(USD),为三个成员组费用之和。不是客户账单或完整 TCO;该记录未确认额外收费。
three-way-20260826T142538Z
公开数据是汇总而非逐题配对结果,无法独立确定改善和退步各有多少项。
n = 20 · 描述性汇总比较,不是通用性能声明。
说明性交互示例,此按钮不会运行客户代码或调用模型。
选择场景并回放展示步骤。演示使用固定示例数据。
Candidate patch modifies astropy/table.py to repair issue
behavior.
The patch applies cleanly, but we cannot call it correct. The test evidence came back inconclusive, and the shadow check flagged repair risk with no reproducible run behind it.
以下三种均为托管服务套餐。从查看记录开始,选择合适的运行额度和工作区用户数量。
所有套餐的模型执行均需自带密钥(BYOK)。订阅包含列出的服务额度,模型费用由供应商另行收取。AdaptOrch 密钥用于服务认证,不是模型供应商密钥。
可选的集合运行在已配置任务中调用您自己的 2–5 个模型。一次接收的运行使用一个套餐额度,供应商分别收取每个成员的令牌费用。费用取决于模型、令牌和尝试次数。工作区用户是人员而非模型成员,一致率不是准确性保证。
模型输出和 AI 解释属于 AI 生成内容,需要人工审查。不要将其等同于执行日志或实际运行的检查结果。
年度金额为 USD 全年账单,不是月度扣款。Pro 每年 $421.20(月均 $35.10);Team 每年 $1,609.20(月均 $134.10)。Starter 不享受年度折扣。
托管套餐不会自动应用或合并代码库变更。单独配置的检查可在商定工作区中应用候选变更,人工审查和实际执行范围始终明确。
月度额度计算已接收的运行,不计算状态或产物查询。额度在接收时而非 SUCCEEDED 时使用。内部尝试属于同一运行,单独接收的重跑再次计数。供应商的令牌费用另计。
代码库命令检查需要单独配置执行环境。升级 Pro 或 Team 不会自动启用托管命令验证;配置和执行环境费用另行商定。
经济性 · 仅为估算。根据你自己的人工价值和成本假设,比较按月付费的托管订阅与自托管。节省效果尚未测量。
正在加载当前月度方案价格…
方案价格不可用,无法计算估算值。请查看下方的当前目录。
请选择方案,并完整填写有效的成本假设。不适用的成本请明确输入 0。
已根据你的假设更新估算。这不是实测节省。
max(0, subscription + extra_provider - self_host_infra) /
hourly * 60
subscription、extra_provider 和 self_host_infra 分别为每月订阅费、额外服务商支出和自托管基础设施成本(USD);hourly 为每小时人工价值(USD)。结果以每月分钟数表示,下限为零。
这是根据输入条件达到收支平衡所需的每月人工时间减少量,不是实测节省时间,也不是完整 TCO。我们不会按小时数或 PR 数量推荐方案。
使用当前每月 USD 价格,而非年度促销价。不包括税费及两种工作流共同承担的 BYOK 成本。初始设置和持续维护并未全部计入,实际总成本可能不同。
检查通过只覆盖实际执行的条件,不代表整体正确性、安全性或未测试条件下的行为已经得到证明。
运行凭据展示已记录的证据。未执行验证的运行不等于测试通过。上面的本地实验测量命令检查,不能证明托管补丁执行或开发者节省了时间。
我们也公开不利结果。合成账本 A/C 对比中,8 项改善、1 项退步。这同时比较了合成和验证设置,并非仅验证器的效果。
如果这个页面上有任何承诺超出了我们能展示的证据,告诉我们,我们会改页面。
通过 MCP 或 API 提交模型任务,查看记录、输出和可用产物。共享托管命令验证默认禁用;代码库检查需要独立执行环境。
我们不提供代码整体正确性的证明。请核对实际执行了哪些验证、记录了哪些证据。没有执行测试的模型运行成功,不等于测试通过。
默认托管流程不会自动应用或合并客户代码库中的变更。独立配置的验证环境可在商定的工作区中应用候选变更以供检查;审查决定仍由客户负责。
当前表格展示五种固定对照输入的本地命令检查耗时。历史台账实验测量的是另一种操作。两者都不能证明你的仓库延迟、托管端到端延迟或开发者节省的时间。
本地对照实验区分了缺失可执行文件与超时,但缺失 Python 依赖被归为普通测试失败。失败标签需要结合上下文,不能保证诊断所有环境问题。
一次接收的运行使用一个额度。状态、用量和产物查询不会创建新运行。完成不是计数触发点,单独接收的重跑再次计数;供应商令牌费另计。
不是。模型可能在没有代码检查的情况下完成。请查看实际命令、结果及跳过或未测试部分;AI 解释不能代替这些记录。
使用适合客户端的文档化 MCP 或 HTTP 连接方式。认证、模型执行和代码库验证是不同步骤,需要分别确认。
报告展示执行记录及可用验证证据。变更文件、前后测试和重跑信息取决于配置路径;缺失的检查必须保持明确。
公开 Starter 连接托管 AdaptOrch。在本机运行客户端不等于自托管服务。如需内网部署,请咨询单独的私有运行器选项。
托管请求经过 AdaptOrch 和你配置的 AI 服务商。提交私有代码前请查看数据传输和保留政策。私有运行器是单独部署,并非 Starter 默认配置。
默认托管服务不包含自动合并。任何主动阻断策略都需根据客户环境和审查政策单独配置及评估。
说明需要验证的问题。先确认执行限制,再在代码库工作前商定范围、交付物和价格。