Jev 深度集成 Aira:从开放意图到可验证设计决策
日期:2026-09-27;2026-09-28 补充团队复核与提交一致性推导;2026-09-30 补充真实探针和约束下的策略推导。性质:集成架构研究;各节实测只对声明的样本与路径成立,不是整体集成完成或工业正确性认证。原源码基线:881e5a9131ee09bc19e145eaa98ab3cdaa776abb;提交一致性补充基线:8abdbdfe790d4067c1c9b421a339b2a966b62e8a,变化见 §11;整体路线复核基线:337b380263feede4b5c108f4ed789cd87362060e,见 §12;约束策略与上下文测量基线:8e8900e083aa51cec0b8b537d71f66a320a43332,见 §16。
自部署替代的固定源码核查、Laya 对比及评分见 Laya 自部署研究。此前 Atlas 调研摘要中的通用延迟/成本承诺、概率严格校准、按固定高置信度静默绑定及模型输出直接充当工程三态裁判等结论未获证据支持;该摘要已退役,原内容保留于 Git 历史。当前集成依据以本篇的条件性保证和真实工程检查边界为准。
1. 架构裁决
Section titled “1. 架构裁决”本篇裁决覆盖模型协作与局部语义绑定;通用 CAD 的表示、构造、编辑、组合、人机沟通和计算边界统一由整体架构 §24定义。候选编译不能单独充当 CAD 的整体架构,也不限制用户的初始意图或设计语言。
确定采用:按未决信息调度的单一设计协调器,将有来源、可扩展的候选绑定编译到同一原生执行路径。 Jev 优先承担已限定适用域的有界语义判断;DeepSeek 补齐缺失的开放解释、分解、关系表达式或程序;确定性核心负责精确值、联合约束、几何、权限和事务;用户决定尚未授权系统代选的真实偏好。2026-10-01 团队推导与反例复核后的具体结构见 §5,备选比较见 §3。架构选择已经确定,单项语义判断的准确性资格限定其自动采用范围,不再通过逐个 CAD 示例反复重选整体结构。速度和费用优劣不作为当前接入前置条件,预算和实际用量仍受控。
LLM 与 Jev 的关系是互补协作。 生成模型承担开放解释、推理、问题分解、构造与沟通;Jev 对当前有依据的语义问题提供可组合判断。LLM 的提议可成为 Jev 的判断对象,Jev 的选定解释与相关信息也可反馈给 LLM,推动下一次推理、方案修订或用户沟通。协作可在生成前、中、后发生,按信息依赖决定先后与并行;两者能力可以重叠,必要生成调用中的判断不必重复调用另一个模型。具体规则见整体架构 §24.6。
Aira 核心计算、检查、维护引用和执行事务;人决定无法从现有信息推出的真实设计取舍。模型反馈保留其来源与适用范围,不能升级为用户授权或工程事实。多种推理模型可以协作,持久设计模型仍只有一个权威来源。所有核心能力必须由原生 Interface 发现和使用,UI 投影同一状态。
这一选择与内核研究的“持久设计图+关系编译器+专用执行”及交互白皮书的观察、候选、检查、接受分离一致。Jev 带来新的语义决策手段;不会自动扩大 AMIR 表达域、检查器接受域或几何算法能力。成功率和体验提升属于待验证的经验主张。
质变的具体目标是三个转变:把一次性语言猜测变成可检查来源、可修订的设计解释;把“画出当前形状”推进为选择未来编辑规则;把失败后的整段重试变成围绕未满足要求继续探索。Jev 为这些流程提供便于程序组合的语义判断,但成果取决于它与 Aira 状态、核心和交互的共同实现。
2. 已核对的上游能力与边界
Section titled “2. 已核对的上游能力与边界”以下为 2026-09-27 查阅的官方契约;模型版本、SDK 版本和服务限制应在实施时再次锁定。
| 事实 | 对 Aira 的直接含义 | 来源 |
|---|---|---|
| Choice 在给定选项中选择,并返回完整分布和 confidence;最多 255 选项 | 可以选对象、关系解释或候选,不能凭空产生未给出的程序;候选不完备时保留 none/other | Choice |
| Score 返回描述性等级位置、分布及 confidence;等级最多 10 个 | 可排序偏好匹配度;不是厚度、应力、公差或精确数值回归器 | Score |
| Noul 返回命题为真的概率,无独立 confidence | 可判断文本是否表达某种意图;不能直接当作工程证据或用户确认事件 | Noul |
| 同一 state 的问题可并行、隔离求值 | 可批量比较语义因素;问题之间不能隐式读取对方答案,存在依赖时必须分波 | 介绍、fan-out |
| confidence 是分布统计量 | 不是另一份正确性验证;不同问题、选项集和模型的阈值不能直接互换 | Confidence |
jev-1.13.0 为当前固定版本;仅文本;请求总量 64k tokens,state 加最长问题 32k |
不能直接读 B-Rep、截图或点云;需有来源的文本/结构化观测,按问题切片 | Models |
| 官方标价输入 $0.042/Mtok、输出免费;250k tokens/s、1200 requests/min,限额可变 | 适合研究高频判断,但不是无限并发或延迟 SLA;网络、重试与核心求值仍要计入 | Models |
| 官方承认数值、间接推理、无关长上下文、对抗文本及跨问题逻辑一致性局限 | 几何和算术交给代码;结构化问题仍需边界验证,不能把预测变成安全边界 | Jev 1.13 jaggedness |
介绍中“增加问题不造成 context rot”指隔离的问题求值;失败文档同时指出无关 state 变大会降低准确性。不能外推成“把全工程、全部历史放进去也无影响”。批处理的收益也不等于任意数量问题拥有恒定耗时。State、fan-out
官方 function-calling 示例将函数与闭集参数映射成问题;这提供了可借鉴的有限选择方法,不意味着 Jev 能生成任意 CAD AST。示例取最弱判断的 confidence 作为调用提示,不能据此推出整次调用的正确概率。Function calling
2.1 服务、数据与部署边界
Section titled “2.1 服务、数据与部署边界”官方服务提供客户应用集成权;公开协议限制将服务作为独立服务转售,以及用其输出蒸馏模仿模型。因此公开 Interface 应提供有工程语义的 Aira 能力,不提供任意 TypeSafe 请求的转售代理。MCA §2
官方承诺不以客户输入训练模型,并为企业客户提供另行安排的 ZDR。公开隐私政策说明服务托管于美国;DPA 和隐私政策按目的必要性描述保留期限,没有给出通用固定天数。不能将“不训练”等同于“不存储”;本次没有核验特定账户的地区、保留设置或企业协议。Legal、Privacy、DPA
所查文档未提供模型权重下载或自托管实施指南;自托管、专有部署和版本长期可用性仍为 unknown。JS 客户端开源许可不代表模型开放。架构应拥有完整本地 CAD 状态与确定性核心,在云判断服务不可达时能继续已知合法操作、保留候选并明确说明未决部分。
2.2 JS SDK 固定版本源码核查
Section titled “2.2 JS SDK 固定版本源码核查”已查询 npm 元数据并读取官方发布包 @typesafe-ai/sdk@0.6.0,核对 SHA-512 与注册表 integrity 一致;没有安装到项目或执行推理请求。固定发布包、上游仓库
| 发布包内证据 | 核查结论与决定 |
|---|---|
package.json、LICENSE |
SDK 版本 0.6.0,MIT;此许可只支持客户端复用,不包含模型权重 |
dist/index.d.mts:299 |
systemOne(request, options?) 返回 APIPromise<SystemOneResult<Q>>;请求承载 state/questions/model,不是生成模型的 messages/tool-call 协议 |
dist/index.mjs:73、dist/index.d.mts:220 |
默认初次请求后最多重试两次,初始退避 500ms、上限 5000ms;默认超时为每次尝试 10 秒,不是总时限。Aira 必须在现有请求生命周期中限制总预算与取消 |
dist/index.mjs:548、:570、:677 |
SDK 校验输入 questions,但成功响应经 parseBody 直接返回;JSON 解析失败返回文本,空体返回 undefined。未完整检查结果形状、问题对应及概率分布 |
dist/index.mjs:510 |
默认拒绝浏览器持密钥运行;不为 Aira 开启 dangerouslyAllowBrowser,供应商调用放在现有服务端 |
真实需求是可靠地接收有身份的语义判断;上游已提供 HTTP、类型、取消与重试设施;已证实差异是运行时结果校验与 Aira 任务/权限绑定不由 SDK 完成。接线采用直接复用 SDK+Aira 网关边界校验,不重写客户端重试栈,不将 Jev 硬塞进 OpenAI-compatible 生成接口,也不增加无职责的转发层。以 RequestOptions.signal 对齐宿主取消,总尝试预算不能假设由 SDK 默认 timeout 覆盖。当前网关每个请求只允许一次可结算 provider call(§11);因此初始接线关闭 SDK 隐式重试。只有每次尝试都能进入既有准入、预留、结算与总 deadline 时才允许重试,不能叠加两层重试或另造通用重试栈。配置、重试
响应校验覆盖:必需问题完整、类型一致、选择来自请求候选、概率为有限范围值且分布满足约定容差、Score 与等级范围、Noul 范围、模型固定版本、usage 与当前任务绑定。异常返回 unavailable/协议诊断,不猜测缺项或默认为通过。日志默认不记录工程正文;官方 debug 会记录 body,不能因为凭据头脱敏就推断正文安全。客户端配置
3. 为什么选择这种组织
Section titled “3. 为什么选择这种组织”| 组织 | 能得到什么 | 代价与不足 | 裁决 |
|---|---|---|---|
| 每步由 LLM 生成,再交 Jev 判断 | 可以保留开放表达并使用同一核心检查 | 已有完整绑定时仍重造输出;遗漏候选不能由后置评分补回;不要求其必然几何不安全 | 必要开放生成后评估是局部分支,不作全局必经顺序 |
| 每次请求前置 Jev 路由 | 已有候选时可以先判断,绑定充分时直接执行 | 已有精确动作无需语义路由;路由答案不能补齐缺失程序;有开放回退时并不必然损失表达域 | 有界 Jev 先行是局部分支,不作全局必经入口 |
| 递归 Jev 选择构造全部设计 | 可组合离散语义选择;代码也可绑定连续源值 | 穷举开放程序不可行;逐字符构造不符合固定模型的官方生成指南;不主张有限选择在原理上无法表达复杂程序 | 保留有界语义组合;缺失开放构造使用生成器 |
| Jev 给 LLM 提供并行建议 | 可以辅助必要的开放生成 | 建议不能替代缺失绑定、用户取舍或检查;答案依赖未满足时不能并行 | 现有建议路径是组件基线,不是完整目标结构 |
| 单协调器按未决信息调度、编译候选并共享核心执行 | 兼容精确直达、有界判断、开放扩展及可信澄清,保留同一提交权威 | 必须承担来源、覆盖、联合约束、依赖、生命周期和预算义务 | 选定的整体结构;具体机制见 §5 |
| 多个模型持有独立可写模型权威 | 可以独立提出方案 | 竞争模型真相与当前编辑、权限、原子历史义务冲突;共享 CAS 的多个提议者不属于这一问题 | 并行读取/提案可用,持久模型与提交路径统一 |
“不计代价集成”应体现在愿意重构决策状态与共享接口,不能让错误预测绕过几何验证。也不应为了使用 Jev,将本可精确计算的数值关系改成模型问答。
“最佳”的裁决范围。 在本项目的准确性优先、开放表达、同一模型权威与有限资源约束下,选定上表中按信息义务组织的结构。理由是它能分别满足精确已有输入、有界语义缺口、开放构造缺口和不可观测偏好的不同输出责任,且无需强制重造已有信息。它包含其他方案的有用局部分支;包含关系只证明可组织这些分支,不能证明有协调开销的实现必然获得最高实际成功率。固定路由加开放回退、LLM 先行加同一核心也可以安全,不能通过删去对手的验证器宣称本方案“唯一可行”。§16.1–§16.2 的数值最优调度需要已知任务分布和误差/观察模型,本次不声称已求出该最优值,也不以这些未知值阻止当前架构裁决。
4. 推导:能够保证什么
Section titled “4. 推导:能够保证什么”4.1 有限判断不必造成封闭表达
Section titled “4.1 有限判断不必造成封闭表达”令当前可提出的语义候选集合为 H,生成/检索/关系编译产生有限工作集 H_t。Jev 只对 H_t 中的候选排序或选择;expand 动作可请求新解释、新程序或更深的原生能力发现。候选来自现有设计图、权威能力契约和开放生成,不来自第二套固定 CAD 工具定义。
在以下前提下,增加 Jev 不改变原有表达域:原来的合法程序入口仍可到达;模型拒判不会把合法程序标为不支持;未选候选仍可重新调度;候选扩展没有被固定枚举替代。它改变的是搜索顺序,而非可表达语言。有限预算下,这些条件仍不能保证找到解。
若生成器根本没提出用户想要的方案,Choice 再自信也无法选中。必须显式保留“均不匹配/信息不足”,并使扩展与澄清成为实际可执行动作;加一个 other 标签本身不证明开放性。
4.2 将语义先验与工程证据分离
Section titled “4.2 将语义先验与工程证据分离”令 G(a,s) 表示动作 a 在状态 s 下满足引用、权限、候选身份、当前 schema、验证和 CAS 规则。Jev 输出 J(s,H_t) 可以影响有界语义绑定、合法候选内的行动选择及探索优先级,但不能改变 G 的义务或签发授权。执行器只接受满足 G 的动作,因此在 G 正确且覆盖所有写入口的前提下,任意错误 Jev 输出均不能使执行器跳过 G。
这是条件性的执行安全,不代表错误意图永远不会被提交:几何正确、权限合法的支架也可能不合用户用途。后者必须通过明确的接受来源、缺失信息处理及语义任务评价改善。核心 pass 也只对其检查域成立,不能升级为完整产品安全证明。
对候选 h 分别保存 semanticAssessment、requirementEvidence 和 acceptanceProvenance。Score 很高不提升证据等级;被检查为 pass 不制造用户接受;用户接受不补齐缺失物性。
4.3 并行边际判断不能冒充联合一致性
Section titled “4.3 并行边际判断不能冒充联合一致性”多题隔离求值不等于各题错误统计独立。多个字段各自选最大概率可能形成不相容组合,例如“保留外廓”“加厚向外”“安装间隙不变”。先进行廉价域与局部约束过滤,再提出或排序有限组合,由核心核验实际深化的组合;不能独立拼出字段后直接提交,也不要求先穷举所有可行组合。n 个各有 m 种选择的字段最多形成 m^n 个组合,并行问答不能消除这项组合复杂度。未检查组合保持未知;问题的信息依赖图不等于约束求解的可分解图。
min(confidence_i) 是保守程度提示,不是联合成功率;∏p_i 只有在正确事件独立且 p_i 适用时才有对应概率解释。即使未来获得每个错误事件的有效上界 ε_i,也只能在这些前提下使用联合界 P(任一错误) ≤ Σ ε_i;Jev 原始 confidence 不是 ε_i 的证书。排序、预算分配可以使用启发式分数,但必须如实命名。
4.4 只对会改变动作的歧义获取信息
Section titled “4.4 只对会改变动作的歧义获取信息”沿用交互白皮书的决策区域:若有依据的解释拥有共同的合法低代价下一步,可以先读取对象或计算候选;当解释导致不同提交或未来编辑语义时,才需要进一步观测或用户选择。
Jev 可以帮助判断文本与解释的相关性,不能凭自己的概率证明解释已穷尽。没有经过领域校准的概率与损失估计时,先用明确规则决定读取、预览、澄清;不把原始概率直接代入 VOI 后声称提问最优。未来校准成立后,才研究预算内期望损失调度。
4.5 批处理与增量的真实复杂度
Section titled “4.5 批处理与增量的真实复杂度”设一次判断所需共享状态大小 S,各题长度 q_i。与每题重复发送状态相比,批处理输入从约 nS + Σq_i 变为 S + Σq_i,但这仅解释输入复用,不证明服务端时间 O(1)。若题目需要不同局部状态,按共同依赖分组;不能为共享而构造巨大全局状态。
依赖明确时,模型修订仅使读取了变更字段的判断失效,避免重新判断全部问题。此保证要求依赖声明完整且身份可靠;若依赖不明,保守整组失效。任意生成程序或全局材料规则可能迫使全局重查,不能声称普遍局部复杂度。
5. 确定的整体结构:候选绑定编译与信息依赖调度(2026-10-01)
Section titled “5. 确定的整体结构:候选绑定编译与信息依赖调度(2026-10-01)”本节定义选定结构;§4、§11 和 §16.2 给出其前提与保证。以下新增字段和分支是目标职责,不是已经部署的公开 API。研究裁决与运行时采用分别记录,当前组件边界仍以 §16.14 的实际证据为准。
flowchart TD T[权威意图、当前设计、未满足义务] --> D[代码读取、解析精确值、发现与约束过滤] D --> B{还缺什么信息} B -->|已有完整明确绑定| C[编译同一原生动作] B -->|有界语义绑定| J[Jev 判断候选] B -->|缺少开放解释或构造| G[DeepSeek 补齐缺失内容] B -->|未授权代选的真实偏好| U[持久澄清与可信用户选择] J -->|可采用且绑定完整| C J -->|不匹配或证据不足| D G --> D U --> D C --> V[联合约束、当前身份、权限与原生检查] V --> W[共享事务、实际读回与恢复点] W --> T每个请求解决一个已声明的信息缺口。调用顺序由依赖决定;已有完整输入可以直接执行,已有候选可以先用 Jev,只有缺失开放输出时才需要生成。图中的循环由代码组织,不由模型自行决定权限、真实状态或完成条件。
5.0 多种输入与引导沟通
Section titled “5.0 多种输入与引导沟通”该结构承接交互白皮书 §3–§4的共同任务状态,入口包括文字、画布点选/圈选、结构树、明确参数编辑,以及有来源的用户选择。用户不必先说出完整 CAD 参数或枚举操作;“有界选择”约束当前机器决策,不要求用户的初始目标已经封闭。
| 场景 | 信息处理与引导 |
|---|---|
| 鼠标选择并说“改这里” | 现行 selection resolver 核对显示来源与 revision,解析对象/实例/子实体引用;多解或过期则重新定位。选择提供空间指代,不能自动扩大到特征、实体或装配的修改权限。 |
| 对象明确,但目标宽泛,如“做轻一点” | 读取现有保持项和可用事实,从现有关系/能力或必要开放生成提出少量方案,保留假设与未检查项,通过可撤销预览帮助用户比较、修改目标。无需先追问全部尺寸。 |
| 解释将造成不同提交或未来编辑 | 展示用户能理解的实际差异,用点选、预览、参数控件或对话取得会改变决定的那项信息;问题措辞与解释可由生成器产生,实际几何及差异由核心计算。 |
| 几何、载荷、材料等证据不足 | 请求适用来源或检查,保留 unknown;用户确认偏好不能代替工程证据。 |
定位引用、编辑含义、要求采用、工程证据是不同的信息轴。 Jev 可解释已有线索与比较当前候选,不能猜测不存在的空间引用或把一次点击解释成完整授权。目标、选择、保持项和已解决澄清共同进入授权状态投影;用户修改其中任一相关项,旧判断须按当前依赖/版本规则失效。当前 selection resolver 与 activeTarget/selection 投影提供部分接线依据,不证明任意模糊多模态对话已经完成。
引导是“观察 → 合法探索/预览 → 获得关键选择 → 更新任务 → 继续”的循环。可以继续的共同合法读取与隔离预览先推进;未解决分歧阻止受影响的提交,不能被解释为禁止一切探索。用户拒绝回答时保留未决项与探索结果,不制造已接受设计。当前没有可信的提问收益模型,因此采用会改变允许动作/结果的明确规则,不宣称提问顺序或整体人机体验已经最优。
5.1 从语义假设变成可执行候选
Section titled “5.1 从语义假设变成可执行候选”当前 DesignSemanticHypothesis 表达含义和未来编辑规则,不能仅凭选中其 ID 就完成建模。目标是在既有任务/frontier 与可丢弃协调上下文中保留候选的以下责任;不另建可独立修改的 CAD 模型:
| 信息 | 必须提供的内容 |
|---|---|
| 缺口 | 缺哪个目标、参数角色、保持规则、关系表达式、构造、外部事实或用户取舍;关联原话和权威要求。 |
| 身份 | task/version/head、当前 schema/catalog、候选及问题定义身份;变化后重新核验。 |
| 候选来源 | 原话的精确值及位置、原生对象/参数/关系引用、能力发现结果,或明确标为 AI 提议的开放构造。 |
| 绑定 | 当前能力的具体输入/程序、尚缺字段、单位与坐标语义、允许修改域和未来编辑规则。 |
| 覆盖 | 声明的判断域、查询和分页继续入口、已省略/未检查项、该局部域中有依据的完整性;不能用非空列表或 top-k 代替。 |
| 依赖与检查 | 完整读取依据、联合约束、实际检查及缺失证据;未求值保持 unknown。 |
| 采用来源 | 区分可信输入、既有接受、授权默认规则、AI 提议和真实用户选择;预测不能制造用户确认。 |
| 判断记录 | 问题/状态/候选身份、实际模型、完整分布、原始 confidence、每次 usage/耗时,以及 answered/abstained/unavailable/stale;运行时核对响应类型与身份。 |
候选来自解析、当前原生状态和关系、权威能力发现、必要开放生成。默认不要求先调用 LLM 来列选项。选择对象/参数/规则的局部集合可以封闭;整个 CAD 语言保留开放发现与程序构造入口。
连续尺寸不离散成毫米枚举。代码找到源值,Jev 在需要时判断它对应的角色,代码复制、转换单位并检查;已知关系由适用核心计算。新关系或构造缺失时,生成器补齐表示,仍进入现行编译和验证。预解析值提取、function calling
递归有界语义选择可以组合复杂结构;不能据单次离散输出证明复杂程序在原理上不可表达。但固定 Jev 1.13 官方指南明确不推荐用链式 Choice 生成文本,因此不采用逐字符、任意数值位串或穷举全部 CAD 程序的构造方式。Jev 1.13:Generation
5.2 具体调度规则与直接执行条件
Section titled “5.2 具体调度规则与直接执行条件”读取当前任务、设计头、授权和未满足义务已有待解决澄清:相关提交受现行屏障约束;可信续跑、共同合法读取和隔离预览可继续完成适用的精确解析、原生读取、能力发现和硬条件过滤已有完整明确绑定:编译到当前 StepDecision / 原生能力缺少候选或必要状态:继续发现、读取;需要构造时只生成缺失内容存在有界语义缺口:相关授权状态 → 独立问题合批 → Jev 选中:绑定精确操作数,核验联合条件和采用来源 不匹配:扩展候选来源,不强迫选择 判断不确定:补证据或请求推理协助,不自动认定用户表达有歧义 真实取舍缺失:持久澄清,等待可信选择 不可用/过期:保留结果与费用,从当前权威状态恢复任何写入:当前身份、权限、采用含义、联合约束与原生检查 → 共享事务实际读回当前结果;按义务核验并保存已接受进度与剩余缺口直接执行的必要条件是:候选给出了完整的现行能力输入;精确操作数、引用、未来规则和允许修改域有来源;语义采用满足其适用域规则;联合检查与当前授权成立;相关待解决澄清没有阻塞该动作。调度前先检查既有屏障,提交时仍由原生原子边界检查,明确参数不能绕过未解决的取舍。仅有候选描述、分数、一个 hypothesisId 或生成器的 done 都不够。编译结果使用已有 StepDecision、SDK 参数校验和 Native 执行,不增加第二个执行器或手写能力表。
没有语义推断的明确结构化输入按既有契约执行。推断性自动绑定要求已声明的支持域、该域所需的状态与候选覆盖、经独立意图判据限定的采用规则、无未决的相关歧义;随后仍执行全部原生检查。未经资格限定的结果作为建议/预览并使用适用的可信接受,不能通过设一个任意 0.85 或 0.9 阈值发布自动执行。
none 只表达所给选项不匹配,不证明候选已穷尽;低 confidence 也不能单独区分缺证据、模型能力不足和用户偏好缺失。三者分别处理。模型重复判断或 Jev/LLM 一致不构成独立真值证据;min(confidence) 只可作为启发式提示,不是联合正确率或官方强制执行标准。Confidence
当可见证据允许不同的实际提交或未来编辑,且用户没有授权系统代选,必须在分歧写入前取得可信取舍。已有保留规则、明确输入和授权默认值属于证据;用户明确委托的设计自由可以由系统行使并记录为提议,不能虚构用户确认。共同合法的读取及隔离、可撤销预览无需等待这个取舍;待决不等于停止全部沟通或探索。
5.3 组合与正确性保证
Section titled “5.3 组合与正确性保证”信息依赖与约束耦合分开处理。 问题所需状态和候选已经存在、答案互不依赖时,才可以一次合批;答案决定后续状态、范围或选项时分波。同批答案也可能形成不合法的参数组合,须检查联合条件;不能把各字段的最大概率拼接后直接提交,不要求预先穷举笛卡尔积。fan-out
令 Ready(c) 表示绑定完整,Meaning(c,t) 表示适用的来源/采用义务已满足,G(c,s,t) 表示现行引用、联合检查、授权及 task/head CAS 满足。目标执行规则是:
Commit(c) requires Ready(c) ∧ Meaning(c,t) ∧ G(c,s,t)若所有写入口执行该规则,核心检查对其声明域正确,且状态比较与提交在同一适用原子边界中,则模型错误不能绕过这些义务;可以对接受的事务序列归纳。该保证不证明任意隐含需求、所有工程性质或几何容差之外的绝对精确,也不证明 Meaning 的模型推断永远正确。几何合法却误解意图仍可能发生,须按独立意图与未来编辑行为验收。
保留原合法程序入口、开放扩展和未检查分支的可再发现性,且不把拒判/低分解释为“不支持”,可以保持原有表达入口;这不证明有限预算必然找到解。局部候选容量、分页和超时只限定工作集,不能悄悄改变建模语言。
5.4 超大规模、长链和恢复
Section titled “5.4 超大规模、长链和恢复”- 持久权威与有界工作集。 原话、义务、已接受含义、可信选择、剩余缺口和恢复点由既有任务/history 承载;
TaskLedger、胶囊和候选页是可丢弃投影。驱逐的信息能重新读取,缺失范围显式保留,不以模型摘要作为唯一备份。 - 复用与失效。 完整依赖包括查询成员及不存在结论、候选集、值/单位、关系、用户规则、可见域、资源和检查器身份;完备时按受影响闭包重算。依赖未知则保守 task/head 整体失效。复用观察不能复用旧提交许可。
- 缓存身份。 判断复用键涵盖租户/授权可见域、任务与依赖、问题/候选/状态定义、模型固定版本、策略和语言/预处理版本;复用观察不宣称重新推理位级确定。只有完整内容身份不变才可保留适用判断。
- 并行与提交。 在运行时支持的边界内并行独立读取、语义问题和隔离候选求值;同一模型提交串行进入共享事务。跨字段/全局约束仍由联合核心处理,信息 DAG 无环不证明几何块可独立求解。
- 事务单位。 大设计链由可检查、可恢复的执行单位组成;不把全部工程压成无限增长的单次事务。不能暴露中间状态的义务使用适用的原子候选单位,尚未满足时保留在预览。
- 不确定写入。 超时、断线和丢失响应不证明未提交;先实际读回任务、head 和相关历史,再决定重试。读回不足保持 unknown,不能盲目重复写入。
- 澄清与续跑。 澄清持久化在原任务,可信选择绑定当前决策;续跑重建当前上下文和检查,不依赖旧进程或旧模型判断。迟到、过期、取消、撤权的判断不授权写入,实际费用仍结算。
- 资源与历史。 候选几何按需物化,拒绝/取消后释放句柄和临时资源;文本候选数量不决定 B-Rep 数量。撤销、重做和恢复重放封存的当前契约历史,不随模型版本重新解释已提交含义。
- 完成。 当前采用的硬义务必须有同声明、容差及 revision 的实际通过证据;相关语义义务另行满足。评估完成、等待澄清和预算停止是独立结果,不冒充 CAD 交付。
若 N 轮反复发送随历史线性增长的状态,总输入可能为 Θ(N²)。有界按需投影消除这一特定增长来源,前提是必要语义可取回;总工作仍受新增设计规模、实际读取量和受影响约束闭包限制,全局耦合可能要求全局重算。长期正确性也不由单次 confidence 保证:只有有效误差上界 εᵢ 才可使用 P(任一残余错误) ≤ Σ εᵢ,原始 confidence 不是 εᵢ。减少不必要推断、检查可检查的错误、保留可信规则与恢复点是结构责任,不宣称任意长链必然成功。
5.5 原生承载与针对性验收
Section titled “5.5 原生承载与针对性验收”| 职责 | 当前承载处与采用边界 |
|---|---|
| 语义候选、可信决定与澄清 | design-task-state.ts、semantic-frontier.ts;语义假设可保留可选的完整计划,只有当前可信选择绑定能直接续跑,缺失构造仍须补齐。 |
| 相关判断状态与接线 | semantic-assessment.ts、协调器 helpers.ts;当前最多 8 假设加 none,作用仍是建议。 |
| 能力契约与编译汇合 | decision-schema.ts 从 SDK 派生;decision-types.ts、executeStepDecision、现行 plan 编译与 Native 执行。 |
| 调度与可恢复工作 | runStepTask、TaskLedger 与既有持久任务;账本不成为第二个状态权威。 |
| 原子提交与澄清屏障 | 现行 candidate lifecycle 与 storage-commit.ts 的 task/head 检查;不能宣称独立于具体写入口与检查域的普遍保证。 |
公开的是可发现、可查询、可执行、可诊断、可恢复的 Aira 能力,协议适配从同一 SDK 权威定义派生。供应商密钥留在服务端;评估读取授权任务投影,调用者不能提交伪造状态、权限或用户确认。实施时同批退役被替换的等价 dispatch;当前建议路径不因研究裁决而自动变成已验收默认路径。
验收围绕六项会改变正确性的前提,使用既有实际 Native 操作,不新增 test/spec 或 Gate:精确源值与角色/空间目标绑定;缺候选/分页后的扩展与弃权;耦合绑定及未来编辑规则;引导探索、可信澄清的持久续跑;task/head/撤权和不确定写入读回;投影驱逐与查询成员变化后的失效。 空间绑定须覆盖当前命中、多解/过期、改选和修改范围;引导须覆盖宽目标先预览、关键分歧提问、拒答继续探索,以及预览不制造接受或工程通过。独立意图标签和原生结果限定语义判断的支持域;脚本通过只验证机制。证明自主任务成功率需要独立留出任务,不能用这些机械检查冒充。整体架构已经裁决,后续验证修正具体机制或采用域,不以逐个产品试用作为重新研究架构的默认循环。
6. 当前源码对应与必须处理的缺口
Section titled “6. 当前源码对应与必须处理的缺口”本表保留初次研究基线的定位;2026-09-28 的当前路径及已改变结论以 §11.1 为准。下列为源码核查,不代表实际运行验收。
| 现有位置 | 现状与集成责任 |
|---|---|
packages/aira-cad-tools/src/tools.ts:66、mcp.ts:24 |
exactCadTools 是共享 AI SDK 工具清单,MCP 从其 schema/执行派生。决策能力若公开,在此唯一权威定义后派生协议,不手写第二张工具表 |
apps/web/src/ai/step/loop.ts:31、loop-types.ts:42 |
已有 runStepTask 和 DecisionSource。当前来源类型仅 scripted/gateway;混合决策需演进此边界及轨迹,不伪装为已有直接支持 |
apps/web/src/ai/step/executor/tool-runner.ts:11 |
同一 SDK schema 校验与 executeTool。Jev 产出的选择仍在这里按宿主契约验证,不直接调用 kernel |
apps/server/src/http/handler/router.ts、model/step-providers.ts |
现有 provider 主要走生成式兼容协议。Jev 应在同一鉴权/准入/记账基础上接专用 typed-evaluation 传输;不能只换 baseURL |
apps/web/src/ai/step/loop-types.ts:70、loop-step-turn/preparation.ts:129 |
当前用量累计与成本采用单一费率;需逐 provider/model/attempt 汇总,包含 Jev、生成、失败重试。已有 post-call 上限不是付费硬预留 |
packages/aira-cad-tools/src/transaction-runner.ts:214 |
已有 preview→validate→commit→readback,含提交后读回恢复。排序不改此权威路径;整个多 step plan 目前不能因此宣称原子 |
packages/aira-cad-tools/src/execution-context.ts:213 |
明确 plan 中各 step 依次独立提交。若产品承诺整项修改原子,要由关系 patch/候选层合成一个提交单位并完成验证,不能靠提示词包装 |
packages/aira-contracts/src/design-task-state.ts |
已有观察、待决、接受来源、澄清与检查绑定。扩展判断依赖及版本,复用其语义,不新建“Jev 设计图” |
packages/aira-cad-tools/src/model-read-tool.ts:454 |
已有 task 读取入口;还需核对判断/候选/接受事件完整的原生读写与诊断发现 |
apps/web/src/storage/aira/storage-repositories.ts:212 |
已有 DesignTask 持久化,但当前 put 为单 store 无条件覆写,没有任务版本 CAS |
apps/web/src/workbench/live-workbench-lifecycle-coordinator/committed-state.ts |
原研究的吞异常定位已过时:当前已 await 保存并传播错误,但仍为模型提交后的独立任务事务;controller 中另有吞错路径,见 §11.1 |
apps/web/src/storage/aira/storage-portable.ts |
已有 designTasks 导出导入接线,不能照旧文档称任务只有内存;新增契约需覆盖导入拒绝、导出范围与重新打开 |
未来修改任务 schema 时,需要明确受影响的当前 .aira 工程和持久任务;不保留旧绑定兼容别名,不静默重解释既有 Revision。研究本身没有修改 schema 或任何数据。
7. 三个完整任务流程
Section titled “7. 三个完整任务流程”7.1 圆板孔阵列:区分同形状、不同未来编辑
Section titled “7.1 圆板孔阵列:区分同形状、不同未来编辑”用户选定直径 120 mm 的圆板,提出 6 mm 安装孔、孔边距外缘 12 mm。已有两种候选:孔心半径固定 45 mm,或外缘间距固定 12 mm。当前外形相同;不能让几何外观掩盖语义差异。
代码解析明确尺寸并计算 60−3−12=45。Jev 判断原话更支持哪种保持关系,结果只是解释建议。若后续规则仍含糊,核心对板径改为 140 mm 做真实候选求值:固定半径仍为 45 mm,固定边距为 55 mm。画布展示差异,用户选择关系;原生执行保存关系和来源,检查孔阵列及保持项,再沿权限和验证路径提交。以后改板径由关系核心重算,恢复不用重新推理。
潜在质变:用户不必先掌握 CAD 约束术语,也能选择未来编辑行为。未实现真实扰动候选或关系求值时,这一流程是设计目标,不能用字符串 predictedOutcome 冒充预览证据。
7.2 电机安装支架:保留开放构造与缺失证据
Section titled “7.2 电机安装支架:保留开放构造与缺失证据”用户给出电机、型材及“容易拆装”。原生查询读回安装界面、包络和已有孔,生成模型提出折弯板、机加工整体件及装配件等可表达构造。核心先判断接口和空间的已知硬条件;Jev 分别比较维护便利性、用户语言对制造方式的偏好、候选说明与已知用途的匹配。
质量、干涉、壁厚和强度由相应核心能力计算;缺失载荷、材料或检查能力保持 unknown。偏好排名不能补全材料参数。没有候选适用则扩展设计,不强选最高分。对关键制造取舍澄清,深化少量构造并检查,提交后持续关联孔、装配、工程图/BOM 等真实可达能力;未接通的分析单独标明。
潜在质变:从“生成一个看起来像支架的形状”转为有来源、可比较、可编辑的工程方案。新增可表达构造和分析仍是 Aira 核心工作,不能归功于 Jev 本身。
7.3 持续修改失败:找到下一项有价值的行动
Section titled “7.3 持续修改失败:找到下一项有价值的行动”用户要求减重且保持安装孔和外廓。核心求值发现某候选违反壁厚要求。结构化 fail 直接淘汰该候选在该要求下的提交资格,不能问 Jev 是否忽略。生成器可提出内腔、局部加强或换材料的解释;其中换材料涉及真实取舍,Jev 仅判断与用户意图的吻合及下一次澄清的相关性。
宿主保留已通过的保持项,按依赖只重查受影响部分。用户在判断返回前修改任务时,旧结果因任务版本失配被丢弃;核心 head 改变也使对应候选失效。网络失败时维持 frontier,由同一协调器选择仍可用的生成/确定性行动或报告 unknown。撤销回到原封存状态,不重新运行 Jev。
不能因修复困难自行放宽用户硬要求。求解器未收敛不等于已证无解;当前有限候选全失败也不证明整个开放设计域无解。若确有覆盖声明域的不可行证明,可报告该域已证不可行;否则保持各候选的 fail 与总体尚未完成/unknown 的区别。
潜在质变:恢复过程围绕未满足要求和仍可用分支展开,而非整段对话从头重做。依赖不全时必须保守重查,不能以增量效率牺牲正确性。
8. 集成依赖顺序与替换边界
Section titled “8. 集成依赖顺序与替换边界”这里描述设计依赖,不维护另一份实施任务清单;实施依据见现有产品计划,任务与验收状态只在 GitHub 开发计划;ACTIVE_TASK只保留执行指针。
按 §12.6 已选择 Jev 技术接入;实现与校准按责任切片并行推进。只读组件及隔离闭环用于及早发现问题、选择策略,不是允许产品集成的总开关。以下依赖按读取、任务持久化和模型接受分别适用,不把完整共同状态、联合提交或调度框架作为所有工作开始的前置。
共同契约与专用传输先形成可用切片。 扩展既有语义候选、任务版本、来源、依赖及原生发现/查询;在契约明确后并行接入现有推理边界。临时只读判断绑定冻结快照、可见域和请求身份,不写任务即可运行;持久观察需要任务身份及适用的 CAS,日志追加不改变意图版本。任务一致性也有独立产品理由。
纵向流程接入同一协调器与执行器。 在既有准入、外发、凭据、取消及逐次结算控制下接 Jev,锁模型和 SDK,完成未来编辑歧义的真实流程。调用需要其适用控制就绪,不等待整个服务资格 issue 完结;部署资格消费这些实际行为。生成、Jev 和直接用户编辑均进入共享执行器;模型或接受写入另须满足最终 task/head 联合事务。图中名字不成为额外空壳转发层。
围绕真实流程深化搜索、恢复与增量调度。 同一协调器允许只读/判断并行,保留未深化分支,并随校准选择调用位置与策略。复杂几何构造继续走开放程序及关系核心,服务不可用使用同一状态内的退化策略,不另保留一套旧聊天执行器。
最后验证生产启用范围。 历史基线通过固定源码/轨迹进行比较;采用替代后同批退役等价旧入口、重复 schema 和记账,不能永久维护两份模型权威。若 Jev 某类判断实测无益,减少该处调用不等于放弃共同状态架构。
9. 怎样证明“质的提升”
Section titled “9. 怎样证明“质的提升””架构推导已经足以选择职责分工;实验用于核对实现与经验收益,不以穷举 CAD 产品作为研究完成条件。下述是未来验证设计,本次没有付费调用或模型成功率数据。
| 待验证主张 | 对照与判据 | 不能替代它的指标 |
|---|---|---|
| 更少的错误意图固化 | 同形不同编辑任务,核对未来尺寸修改后关系及接受来源;统计错误静默提交 | 当前外形相同、答案 JSON 合法 |
| 更有效的发现与组合 | 首次接触契约、候选集中缺少正确项的任务,核对能否扩展并完成原生操作 | 固定工具集上的分类准确率 |
| 更有效的恢复 | 相同失败输入,核对保持项、恢复后模型及下一步成本 | 错误说明更流畅 |
| 更好的预算内完成率 | 固定总预算与独立需求判据,统计所有 pass/fail/unknown/未完成 | Jev 单调用速度、脚本通过率 |
| 更低的用户负担 | 用户决定次数、返工、错误对象、完成时长和任务结果联合评价 | 少几个 token 或少问一句话 |
实验设计:需求由独立于候选操作序列的文字/初始模型/最终及未来编辑条件定义。至少覆盖定位与关系歧义、开放构造、跨部件修改、诊断恢复四类;中文为主,英文配对单列;加入数值边界、无正确候选、冲突要求、长无关状态、过期 revision/任务、断网和提示注入情形。
采用三个主要对照:当前实际 runStepTask bounded-step 生成式基线;相同新候选/状态架构但不使用 Jev 的决策策略;完整 Jev 方案。后两者隔离“架构重构”和“Jev 判断”的贡献。按需消融批处理、增量依赖与澄清策略,不拿所有改变一起做出的结果归因于单个模型,也不人为换成较弱的全量 schema 基线。
探索、开发校准与独立留出按需求来源分组;配对语言与选项排列属于同一需求簇,不能跨组或增加独立需求数。初始工程、seed、模型/SDK/策略、容差、候选/检查预算在执行前冻结。唯一正式采样协议与实际样本量由 #355维护,根据所主张效应、误差界与需求差异确定;不另保留一套示例规模。探索中看过的留出须换新。
每个需求比较相同总费用上限(可先用现有 $5 任务上限)、生成模型配置、几何/分析预算与最大用户交互预算;生成、Jev、重试、翻译/提取、候选检查全部记账。延迟作为独立结果报告 p50/p95,不仅比较某个请求;失败和未知也保留在分母。随机模型可重复运行同一需求,报告需求数与尝试数,重复次数不是独立需求数。
预算可设多档形成成功率—成本曲线;核心绝不因模型不同而降低验收要求。置信度按问题类型、模型版本、语言和候选数量分层校准,统计接受覆盖率与错误率;不得用供应商示例中的 0.8/0.9 阈值直接宣称可上线。
执行沿capability-explorer与现有真实原生 Interface;其现有五个固定程序族只能覆盖相应几何行为,需要扩展需求输入与轨迹核验才能评价语义任务。不能将它们的确定性通过率称为 AI 自主成功率,也不新增 test/spec、mock 建模执行器或 Gate 包装命令。
智能收益目标的启用判据(硬离线/数据边界目标按 §11.5):几何、权限、来源、CAS、撤销重做与恢复的受影响行为没有已知回退;在预先锁定的主要需求分布及可比总预算下,独立留出展示成功率、返工或用户负担中至少一项有可信改善,其他关键指标满足预定容忍界。容忍界和统计方法必须在查看留出前确定,当前没有数据支持具体提升幅度。任何来源错绑、越权、过期提交或 unknown 冒充 pass 都应先修复再评估。
10. 研究边界
Section titled “10. 研究边界”本次完成的是官方资料与项目源码核查、架构职责推导和可执行方向设计。Jev 的 CAD 准确率、中文校准、延迟尾部、端到端收益及真实几何/恢复行为均尚未实测;构建通过不能填补这些证据。
上游契约、项目接线、架构推导分别经过 Antigravity 并行调研和主审交叉复核;SDK 发布代码已额外直接读取核验。研究文档的本地链接、源文件路径和 JSON 示例完成静态核验。没有修改产品运行时、依赖或 schema,没有执行 Jev 推理、CAD 行为验收、构建或部署;本次文档工作不需要以构建替代研究证据。最终研究不把供应商的快、准、校准等主张直接转换成 Aira 产品指标。
11. 2026-09-28 团队复核:统一设计决策与提交一致性
Section titled “11. 2026-09-28 团队复核:统一设计决策与提交一致性”本节补充架构、源码、上游与评价三路研究及交叉质询后的裁决。源码基线为 8abdbdfe790d4067c1c9b421a339b2a966b62e8a,不是对旧任务状态的复制。仅进行了源码和公开资料核查;未调用模型、下载权重、运行产品验收或修改运行时。旧评分和供应商性能说明不能填补这些证据。
11.1 当前实现与真正缺口
Section titled “11.1 当前实现与真正缺口”| 责任 | 当前源码事实 | 必要变化及边界 |
|---|---|---|
| 任务语义 | packages/aira-contracts/src/design-task-state.ts:187–203 已有持久任务、revision、要求、观察、待决项及决策记录,无 taskVersion |
扩展现有权威契约;不能把 currentRevisionId 或时间戳当作同一模型上的意图版本 |
| 任务持久化 | apps/web/src/storage/aira/storage-repositories.ts:269–273 无条件 put;任务已进入项目导入导出 |
所有可写任务入口采用预期版本 CAS;不能再称任务仅在内存,也不另建任务数据库 |
| 提交后的任务写入 | apps/web/src/workbench/live-workbench-lifecycle-coordinator/committed-state.ts:83–118 先发布快照,之后 await 任务保存并 finally 关闭库 |
不再吞该路径异常,但它仍不是与模型提交原子的接受来源;不能把 await 当作跨事务原子性 |
| 草稿保存失败 | apps/web/src/workbench/live-workbench-controller.ts:104–114 仍后台保存并 catch 空处理 |
明确错误和冲突;保留可恢复草稿,不能显示已持久化成功 |
| 模型持久提交 | apps/web/src/storage/aira/storage-commit.ts:159–180 同事务校验 expectedHead 并写修订、证据及导航,不含 designTasks |
在此融合任务版本与接受事件的原子校验,不新增提交执行器 |
| 用户接受 | 既有 candidate coordinator 默认不宣称用户接受;candidate lifecycle 只在显式 review 后记录 user,但发生于 commit/install 之后 | 保留可信入口,前置准备接受输入,与成功提交共同保存;安装修订不能自行创造接受事实 |
| 共享执行 | apps/web/src/workbench/agent-task-coordinator/coordinator.ts、apps/web/src/ai/step/loop.ts 已有协调、取消和共享执行 |
演进现有调度职责;不加一层 Jev router 后再保留两个竞争循环 |
| 语义终态 | coordinator 的 complete 检查要求修改或导出;loop-types.ts 只有 scripted/gateway 来源 |
为有身份的评估/澄清任务增加合法终态,同时保留建模任务必须有实际建模证据的检查 |
| 生产费用保护 | apps/server/src/access/security-control-plane.ts:175–186,215–229,311–325 已有预留、幂等结算、缺失 usage 的保守上界 |
复用这些保护;缺口是 typed 请求、逐模型/尝试和整个任务的账目贯通,不是从零重写网关 |
| 尝试次数 | apps/server/src/http/handler/router.ts:261–279 一个 step 只准一次 provider call,并要求结算 |
SDK 默认隐藏重试不能直接接入此假设;每个可计费尝试必须可见且受准入控制 |
| 任务总账 | apps/web/src/ai/step/loop-types.ts:70–78 用单套费率,loop-step-turn/preparation.ts:104–146 主要核验累计量 |
逐 provider/model/attempt 汇总;本地算力计量不套 Jev token 单价。Node 本地执行与生产准入路径须分别验收 |
11.2 一个模型权威、不同职责的状态与身份
Section titled “11.2 一个模型权威、不同职责的状态与身份”AMIR/Revision 保存已声明的设计语义;DesignTask 保存有来源的观察、未决解释、候选及接受过程。后者不能成为可独立修改的几何模型,全部探索内容也不应进入 modelHash。已经接受的未来编辑规则必须成为实际设计语义,不能只存在于聊天或评分记录中。
任务版本应覆盖会改变设计决策的可编辑输入。语义判断和尝试记录绑定其读取的版本;追加只读判断记录本身不应偷偷改写意图版本,使其自身或同批独立判断无限过期。具体存储字段由当前 contracts 设计确定,本文符号不是已实现 API。
区分语义假设身份与具体构造 CandidateId:同一当前形状可以对应不同未来编辑规则,一个解释可以产生多种合法构造。语义身份至少覆盖含义、保持项、允许修改域、假设及来源;具体构造身份继续由既有候选与 validation 权威产生,AI 不猜造 hash。
semanticAssessment × requirementEvidence × acceptanceProvenance 是互不升级的事实轴。语义评分不能产生工程 pass;几何 pass 不能制造用户接受;用户接受不能补齐缺失物性。可信用户动作或已有委托策略提供接受来源,供应商输出与 AI 工具参数不能自行签发 actor:user。
11.3 联合 CAS 的线性化点与证明边界
Section titled “11.3 联合 CAS 的线性化点与证明边界”设一次拟提交绑定为
B = (project, branch, expectedHead, expectedTaskVersion, semanticHypothesisHash, CandidateId, acceptanceSource)。
只在模型回复或 commit 前检查 taskVersion 存在检查后使用竞态:检查后用户可能只改意图而不改 head,旧判断仍能通过纯模型 CAS。因此最终校验必须进入现有 persistCommit 的同一 IndexedDB readwrite 事务:加入 designTasks,原子读取 head/task,核对 B、可信授权及候选/验证绑定后,共同保存修订、证据、head/reflog、不可变的已提交接受事件及任务指针。网络推理、几何求值和等待用户均在事务外完成,不能把长任务放入数据库事务。
线性化点是该持久事务提交。若意图更新先成功,旧提交因任务版本不符而拒绝;若 CAD 提交先成功,后来意图是新的任务版本,不能追溯改写此前接受事实。接受尝试可早于提交;“已提交接受事件”不能在提交之后以独立后台写入补造。
在所有相关任务写入口共享同一可串行化存储域、来源可信、输入内容身份与工程证据正确、失配必拒绝的前提下,可以保证每个成功持久提交对应一个同时有效的任务版本、模型 head、候选和接受来源。这不证明用户意图正确、候选穷尽、检查器无缺陷,也不自动产生跨数据库的分布式原子协议。
草稿观察单独 CAS 保存,不要求每次观察都产生几何修订。采用无环构造:任务/假设内容身份 → 候选及既有检查身份 → 接受负载 → 提交。接受负载绑定这些前置身份,不包含未来 RevisionId;最终 Revision 与 acceptanceHash 的关联在同一不可变提交记录或证据封装内原子保存,接受负载不能反向引用包含自己的 Revision。最终字段与当前 Revision 身份规约统一,不另造第二份 modelHash;影响设计含义的内容进入现有设计契约,审计性接受来源按当前不可变证据机制绑定。资源沿既有生命周期:对预先暂存的不可变资源核验引用闭包,不因增加任务关联而机械重写全部资源存储。
若内存核心已经推进而持久化失败,应按既有恢复/bootstrap 重新核对权威 head,并明确是否已持久提交;不能谎称全部回滚。取消发生在持久提交之后不撤销已经发生的提交。未知写结果先读回再决定恢复,不能自动重试写入。
11.4 调度、原生能力与恢复
Section titled “11.4 调度、原生能力与恢复”采用现有单协调器演进:按任务未决问题调度读取、候选扩展、判断、澄清、真实候选求值、提交与恢复。未深化 frontier 首先是语义候选集合,不意味着立即创建多份 B-Rep。有限预算保留未检查分支及原因,不将低语义评分记录为数学不可行。
通过现有 SDK 权威定义公开任务/候选读取、受限判断请求、解释提议、可信接受及失效诊断;MCP 和 UI 派生同一能力。外发权限单独约束被评估的资料,不能因有 CAD 写权限就允许把全部工程发送给模型;也不能暴露任意供应商请求转售接口。缓存包含授权可见域,权限变化即失效。
predictedOutcome 文本只能作解释;真正的“以后改尺寸会怎样”必须来自绑定任务/模型/候选及求值身份的反事实几何预览。对于澄清待答、评估完成、拒判和暂不可继续,使用合法的语义任务结果;不得为满足旧 complete 检查伪造修改,更不能放松普通建模任务的完成证据要求。
当前多 step plan 每步独立提交。若用户承诺是一项整体修改,应在 patch/candidate 层合成为一个受检提交单位,而不是用协调器包裹多个提交后称其原子。
恢复读取已封存的设计语义和接受来源,不重新询问升级后的模型解释旧 Revision。未接受分支可以在新版本下重新评估,但产生新 attempt、保留旧来源。服务不可用时保留未决状态,继续确定性合法操作或澄清;不得未经已声明策略和授权自动外发到云或切换模型。符合相同契约的已授权回退由同一协调器决定并记录新 attempt,不维护第二套旧 CAD 执行器。
11.5 采用判断与评价顺序
Section titled “11.5 采用判断与评价顺序”上游 2026-09-28 复核仍支持 Jev 的类型化问题/答案、固定版本与 confidence 边界;这些是协议事实,不是 CAD 经验收益。官方 API、模型说明、confidence。Laya 的身份、编码和离线条件见对应研究 §8。
先固定状态、候选和独立标签筛选组件,再比较 A=当前真实生成式流程、B=新共享状态/协调器且使用同一生成模型、C=B 加 Jev 判断。A/B 区分架构收益,B/C 区分判断实现及其调度策略的增益;C 的调用位置比较见 §12。Laya 对照和自部署已暂缓,不是本轮前置;组件不合格的候选不必消耗完整端到端实验预算。对照是不同实验条件,不是要求产品保留多个生产执行器;旧基线使用固定源码或隔离运行。
生成模型配置、任务来源、候选/几何预算、用户交互预算及总资源口径保持可比;所有重试、翻译、提取、云费用、本地资源占用和失败均计入。不同 tokenizer 的 token 数不能直接当等价成本。真实几何正确性与语义正确性分别判定,错误接受、unknown 和回退不从分母消失。
原 §9 的 80/40/80 是完整任务设计,Laya 的 90/90 是组件任务组设计;均是未执行建议,不合并成统计充分性证明。具体 campaign 在 GitHub 评价 issue 中冻结唯一协议,明确聚类、独立留出、主要指标、误差/资源阈值及样本量依据。概率校准仅对有独立标签且语义适用的输出进行,confidence 和 Score 期望值不能直接当正确概率。
具体判断策略的发布需满足受影响的几何、权限、来源、原子提交和恢复硬条件,以及该决策域预定的质量/资源要求;若主张智能收益,独立留出在预定预算下须支持主要指标改善,其余关键指标符合预定容忍界。若未来目标是硬离线或数据不出域,则另验证该硬要求及质量/资源门槛,不虚称成功率提升。某处调用无收益时调整或停用该处策略,沿同一共享架构处理未决工作;不因接线投入强制每步调用 Jev 或串联暂缓的 Laya。技术接入选择与这些策略、部署和收益验收不是同一层结论。
11.6 交叉讨论中的裁决
Section titled “11.6 交叉讨论中的裁决”- 否决“先接两个模型再看”:先明确任务、语义候选、接受及失效的责任,再用可比证据决定判断实现。
- 否决“已有 expectedHead 即可”:同 revision 的意图变化要求 task/head 联合 CAS,检查必须在最终持久事务内。
- 修正“任务保存仍一律吞错”“网关没有预留”:当前部分路径已修复且生产预留已存在;保留的是精确定位的剩余缺口。
- 否决“语义任务也必须修改模型”:新增合法语义终态,同时保留建模完成证据。
- 否决“同样 API 就直接切 URL”:保持共同的 Aira 语义契约,但供应商身份、编码、概率、usage、错误及生命周期差异必须明确。
- 保留研究边界:本节的架构保证是条件推导,当前源码结论是静态证据,模型收益和运行资格仍未验证。研发状态只在既有 GitHub milestones/issues 维护。
12. 全流程效率与质量路线复核(2026-09-28)
Section titled “12. 全流程效率与质量路线复核(2026-09-28)”本节补足调用拓扑、直接语义绑定、上下文发现及策略比较;不把已有 §§3–5 的协调、批处理与恢复研究重新宣称为首次发现。三路复核分别检查官方机制与架构、当前实际实现、评价与反例,再交叉质询。基线为 337b3802;以下源码观察与架构推导均不是模型实测。用户已取得 Jev Early Access,Laya 自部署暂缓。研究问题是整个 Aira 的效率与质量,而不是让 Jev 取代 LLM。
12.1 官方机制如何映射到应用,而非只接评分 API
Section titled “12.1 官方机制如何映射到应用,而非只接评分 API”| 官方机制与证据 | 对 Aira 的推导 | 明确边界 |
|---|---|---|
| Intent routing:请求可路由至代码、专用模型或人 | 可以在开放生成前判断某些已有语义,不必强制 LLM 先造候选 | 不使路由标签成为能力上限;路由错误不能永久隐藏发现入口 |
| Fan-out 与 State:同一状态下多题独立求值 | 对相同已知依赖的一组判断共享输入;必要读取、生成与独立判断可重叠 | 同波问题不能使用另一题尚未返回的答案;不同授权域不合批;全工程塞入同一 state 并不合理 |
| Function calling 与 原文值选择 | 从当前对象、原生能力、合法枚举和原文候选值中直接提出语义绑定,代码复制、解析和校验 | 闭集局部能力不等于离散化整个 CAD;数字来自原文/代码,不拿 Score 猜尺寸;误选角色仍可能发生 |
| Skill suggestion:建议相关能力,同时保留生成模型的完整发现与判断能力 | Jev 可辅助 LLM 选择相关能力、资料和下一次读取,二者协作而非相互替代 | 官方示例使用从目录生成的请求;不能迁移为 CAD 成功率,也不能借建议取消未选能力的可发现性 |
| Composite scoring 与 SDE cascade | 分别核对语义维度、识别需要进一步解释/生成的结果,让昂贵工作用于未解决部分 | 权重不能抵消必需条件;语义核对不取代确定性事实检查,追加复核也不必然增益 |
| 模型与语言、Confidence、局限 | 固定实际模型身份;中文、状态投影与数值/间接推理分别验证 | 本轮复核文档仍列 jev-1.13.0;不以示例阈值作正确率,不以输入无类型错误作意图正确 |
12.2 推荐的责任与调度推导
Section titled “12.2 推荐的责任与调度推导”每个设计动作所需信息分为:已经明确且可直接执行的事实;能由代码计算的事实;已有材料中的语义关系;必须开放构造的新解释/程序;只能由用户决定的偏好。分别交给原生执行、确定性计算、Jev 等语义判断、生成模型、用户。它们可以共同解决同一任务;没有理由强制每个动作经过相同的模型序列。
因此推荐在现有单协调器中按未决信息及其依赖调度。这是一项职责裁决,不是经验最优证明。已有充分绑定的合法操作直接执行;需有界语义选择时可直接问 Jev;需要新解释、问题分解或构造时调用生成模型;已有问题可与不依赖其答案的读取或生成并行。Jev 结果可以是建议,也可以在已声明的局部语义域内构成操作提议,均进入同一执行与接受路径。没有强制全局前置分类器,也没有强制逐步评审器。
生成模型可以提出针对新任务的问题和候选,但不能通过自己定义问题、自己判断这些问题通过,证明原需求已满足。问题须有要求来源、读取依赖、明确含义、适用域和缺失出口;宿主校验结构、可见状态、资源及引用绑定,独立需求判据核验语义遗漏。完整问题覆盖不能从合法 Schema 推出。重复提问达到预算后保留未决状态,不无限自评。
对于同一状态切片的独立问题,批处理减少重复输入与往返;只有答案不互相依赖且授权范围一致才可以同波执行。并行分支开始前明确结果的使用点,迟到的建议不改写已采用的语义,取消/失效不抹去已消耗费用。建议未返回时可以继续本来合法且不依赖它的工作,不能把可选建议变成隐式阻塞。结果复用必须匹配任务、可见域、状态依赖、问题/候选、策略和模型身份;依赖未知时保守失效,已提交设计不重新推理。
串行额外判断的收益条件是其减少的读取、生成、错误深化、修复和人工负担,足以抵偿状态准备、模型往返与误判成本。若两个工作确实独立且资源无争用,重叠的理想下界由较慢分支主导;实际结果还受合并等待、限流、缓存失效与废弃工作影响。批量问答和较少 token 均不能证明整体更快。初期用明确的依赖与预算策略,未经校准不宣称期望信息价值调度或全局最优。
12.3 全流程适用面与质量责任
Section titled “12.3 全流程适用面与质量责任”| 决策位置 | Jev 与其他职责的协作 | 要观察的收益与主要反例 |
|---|---|---|
| 能力/证据发现与上下文准备 | 确定性检索提供可追溯候选;Jev 建议相关项或下一次读取;LLM 保留继续发现入口 | 减少无关读取和错误能力选择;漏召回不能由重排补回,删掉关键要求可能使错误结果更自信 |
| 目标、作用域、保持项和原文数值角色 | 原生状态、解析器或 LLM 提供候选;Jev 绑定语义角色;代码解析单位、校验引用与组合 | 减少对象/实例/尺寸角色错误;原文片段选错仍可得到合法数值 |
| 开放构造及候选深化 | LLM/关系编译产生解释和构造;Jev 比较语义适配;核心按需计算实际几何与编辑后果 | 减少错误分支上的昂贵工作;未生成的正确解释和未检查的组合不能被当作不存在 |
| 澄清与实际交互 | Jev 帮助定位解释分歧;宿主先做共同合法且有用的读取,必要取舍交用户 | 减少无用问题与返工;低置信度不等于必须问人,高置信度不等于用户授权 |
| 失败恢复与完成核对 | 已有明确恢复语义的核心错误先走确定性处理,其余保留诊断与 unknown;有语义分歧的修复由 LLM/Jev 协作;语义要求与工程证据分别核对 | 减少重复探索和假完成;判断器不能把 fail 改为 pass,LLM 生成的问题不能成为唯一验收标准 |
| 资料/社区检索 | 后续复用同一相关性能力处理材料、零件和公开版本发现 | 属于相同机制的次级应用,不因本次研究扩大社区功能或把相似内容视为工程认证 |
关键质量目标是正确意图、未来编辑行为、成功恢复和真实完成;核心强制检查不允许为了减少调用而绕过。不能用“当前几何相同”抵消选择了错误的未来编辑规则。
12.4 现有实现约束与基础缺口
Section titled “12.4 现有实现约束与基础缺口”runStepTask / DecisionSource、createStepGatewaySource 及 deepseek-step.ts 当前将语义决策交给生成式 step 来源。capsule-builder.ts、工作集与日志已有有界页面、缓存和摘要;评测必须使用这些真实机制,不虚构每次把全目录发给 LLM 的弱基线。增加判断不得破坏已有前缀缓存而不记成本。Jev 专用传输复用服务准入和逐次结算;SDK 复用责任沿用 §2.2,具体锁定版本在接线时复核,不将它伪装成生成模型协议。
本次发现一个先于模型重排的检索缺口:searchExactCapabilityCatalog 按 ASCII 字母数字分词,非空纯中文 query 得到空 tokens,按能力 ID 返回受 limit 限制的列表;rankLibraryEntries 对不可分词查询返回空列表。两者对“无法检索”的处理不同,均不能证明用户所需能力不存在。这是静态源码定位,尚未执行原生 Interface 验收。应先确定和修复多语查询及覆盖/分页/诊断语义,再测 Jev 相关性收益;不能只重排漏召回的 top-k 或增加 prompt 来掩盖基础能力缺口。
实现只演进当前任务、来源调度、推理请求、执行和恢复路径;候选来源和问题可以变化,能力权威仍从当前 SDK/Interface 派生。对于一项承诺原子性的用户修改,沿 §11.4 构造一个受检候选,不能把多个独立 step 提交包装成整体原子。
12.5 比较什么,如何据此选择
Section titled “12.5 比较什么,如何据此选择”保留 A(真实现有流程)与 B(新共享职责、同一生成模型且无 Jev)以区分架构收益;在 B 的同一语义与执行路径中比较有理由的 C 策略:串行前置、候选后判断、并行建议、按依赖调用。前置和后置分别提供成本/遗漏的对照,不预设全部任务都应走最复杂策略,也不要求全排列。先修基础缺陷并单列其前后变化,不能把修复收益算作 Jev 增益。
组件阶段使用固定状态、相同问题和独立标签比较答案质量与串行/批量成本;它不能证明自主生成候选的质量。策略校准再覆盖发现、缺正确候选、未来编辑和恢复等不同信息义务。最终只冻结一种有明确分支规则的策略用于独立留出,不事后按每个任务挑最佳路线;生成模型、Jev、预算和正确性规则固定,探索过的任务不能充当独立验收。实验用于关键前提与实际收益,不以穷举 CAD 产品为研究前置。
计入状态读取/提取、翻译、动态问题生成、所有模型调用、无效推测与迟到结果、LLM 缓存损失、核心检查、修复及人工澄清。分别报告候选覆盖、条件选择质量、错误强选、语义/未来编辑正确性、恢复与预算内完成、关键路径延迟和总费用;失败与 unknown 保留在分母。相关问题的概率不相乘当联合正确率,不能按所选动作的存活样本单独报告成功率。
收益评价目标须在独立留出之前明确:质量非劣且总成本改善,或质量改善且成本满足容忍界。两者存在取舍时报告质量—成本边界,不称普遍最佳。结果用于选择和调整具体调用策略,不作为共享契约、typed 接入及协调器研发的全局许可。原有语义/权限/几何/提交/恢复条件仍是硬要求。具体实验预算、样本及执行次序只在 #355/#340 维护;本篇不给新的示例数字或复制任务状态。
12.6 技术接入选择、策略校准与发布边界
Section titled “12.6 技术接入选择、策略校准与发布边界”团队复核区分三层结论:选择 Jev 与生成模型、确定性核心协作的技术接入;通过实现和实验确定调用域、位置、拒判阈值及实际收益;按声明的运行模式完成发布资格。 官方能力与条件性职责推导支持第一层,不需要先证明全 CAD 净收益才可研发;后两层不能由官方示例、Early Access 或架构推导冒充完成。§12.2 组织共同责任,不把 Jev 固化为每个动作必经的入口或评审器。
Aira 的有界语义判断、多题共享状态和开放生成之间存在明确的职责匹配;Jev 可协助选择信息、绑定语义、深化候选、澄清和恢复。结构化输出本身并非 Jev 独有优势,生成模型也能在原本必要的一轮中完成判断。新增调用仍有状态准备、往返、计费、失效和供应维护成本,两个模型也可能共同遗漏要求。已有云生成模型不消除新增供应商的数据边界,但这不是首次网络依赖。官方案例支持互补的可能,不证明 Aira 的中文 CAD、未来编辑质量或总体成本已经改善。
实施与校准共同推进:可先用真实需求和已有候选的只读影子判断定位组件问题,并在隔离可丢弃 session 中通过既有原生 Interface 比较完整闭环。强基线保留生成模型在必要生成轮内的结构化判断,以及适用域内的确定性规则;额外 LLM 判别调用只是补充对照。状态与候选覆盖保持可比,计入准备、翻译、等待、无效建议、修复、核心检查和人工负担。组件结果不能替代真实流程的行为验收,也不成为整个协调器研发的前置开关。
接线沿现有服务边界复用 SDK,补齐 typed 校验、有限状态/问题投影、取消和逐次结算;不另建执行器。临时只读判断绑定冻结快照与可见域;持久判断消费任务身份及适用的 CAS;模型或接受写入再消费最终 task/head 联合事务。已授权调用使用实际就绪的准入、外发、凭据和尝试控制,不等待全部发布资格完成才获取运行证据。领域校准、协调器演进和生产服务责任进入既有计划,具体开发状态仍由 GitHub 管理。中文发现修复、任务一致性、可信接受与核心恢复具有独立理由,不把其成本或收益全归给 Jev。
若某调用位置的完整流程质量/成本不能抵偿其代价,或候选缺失、中文/否定/作用域误判、错误剪枝及问答维护负担使该策略不满足预定要求,应调整、停用该策略或缩小其发布域;不能为使用模型而保留无效调用。必需的授权、出站、服务或事务条件不成立时,阻断对应运行路径。若新证据否定承担该职责的关键前提,应明确重新裁决,而不是以既有投入保护实现。已选择技术接入不等于冻结调用策略,也不等于提前宣布产品收益。预算与正式判据由 #355/#340 管理,部署资格由 #368 消费集成证据;本轮没有实际模型调用,任何具体效果仍未验证。
13. Jev 真实调用的首轮组件探针(2026-09-30)
Section titled “13. Jev 真实调用的首轮组件探针(2026-09-30)”本节更新前文截至 2026-09-28 的“尚无实际模型调用”状态,不替代 #355 的独立任务评价。源码基线 9813d0fc,工作区在调用前无跟踪文件改动。使用现有 createJevAssessmentCaller 和本地私密配置中的 Jev key,固定请求模型 jev-1.13.0;调用从 Node 服务端组件直达 TypeSafe,未经过 Aira HTTP 准入、原生 Interface、真实 CAD task/head 或几何核心。输入均为研究者预先写定的合成文字,不含用户工程数据。每个输入一次调用、无 SDK 重试、15 秒超时;总上限 10 次。固定枚举的十个场景分别覆盖中英文明确关系、信息不足、正确选项缺席、选项顺序交换、当前形状相同但后续编辑规则不同、引文指令、冲突要求、明确否定和比例关系缺项。它们是探索样本,不能在后续独立留出中复用;未设随机抽样、需求分布或泛化置信区间。
| 观察 | 结果与解释 |
|---|---|
| 明确的中英文边距意图、交换选项顺序、明确孔心半径与否定表达 | 均选择预设的编辑规则;仅验证这些文字和当前候选集上的组件行为。 |
| 信息不足、缺少正确选项、比例关系不在候选集 | 均选择显式 __abstain;候选缺口仍需由 Aira 的候选扩展或澄清流程处理。 |
| 引号内的第三方“选择另一选项”指令 | 本次仍选择用户要求的边距规则;单例不构成对抗输入安全保证。 |
| “外径变大、孔径不变,同时保持孔边距和孔心半径” | 预设应拒判的冲突案例中,Jev 选择了边距规则,confidence=0.28,选项概率约 0.52/0.23/0.25(边距/孔心半径/拒判)。这是一次明确的错误强选;低 confidence 并不会自动把当前 caller 的 selected 转为 abstained。 |
按预设期望,十个固定输入中九个匹配、一个不匹配;这不是 CAD 准确率或统计意义上的模型成功率。实际返回模型均为 jev-1.13.0,总输入 5,312 tokens,按官方价格 $0.042/百万输入 tokens 估算供应商输入费用约 $0.000223,不含网络、宿主处理、候选生成和后续 CAD 检查。客户端测得单次 229–1,302 ms;样本极小且首调可能含冷启动,不能外推延迟 SLA。输出 tokens 不计费,但也不因此把完整工作流成本视为零。
本次探针支持继续把 Jev 用于有界、可拒判的语义候选判断,但不支持由 Jev 单独裁定冲突、几何可行性或提交。冲突案例应先由确定性约束检查辨识;无法证明一致的组合保持 unknown 并走澄清或实际核心求值。原始 confidence 不是正确概率,具体自动采纳阈值需要独立领域数据校准;不能因为本次一个低分错误就事后设一个阈值并宣称已验收。当前服务端无浏览器 IndexedDB task/head 的可信投影,正式网关在缺少 projector 时保持 503;原生工具的 evaluate 仍不可用。因此这组调用只证明真实凭据、SDK 传输、模型身份及基础问答路径工作,不证明发布路径、权限、版本一致性或自主建模收益。下一阶段沿现有 #367/#355/#368 分别解决可信只读观察/权威状态接线、可比任务评价和运行资格,不用未验证的 client-uploaded backup 冒充 task/head 权威。
独立架构审查还指出当前 caller 把 snapshotId、revisionId、taskId、taskVersion 与语义文本一同放入 Jev state。这些身份必须由 Aira 网关绑定和重查;是否也让模型读取,应针对相同语义输入做有/无元数据的对照,而不是假定其必然改善或损害准确率。优先让模型状态只含判题必要的、带来源的语义切片,并将身份保留在宿主请求记录。个人版的“可独立自托管”也不等于“必须离线使用 Jev”;网络语义能力可选,离线时确定性 CAD 核心及可明确诊断的未决语义能力仍应工作。当前契约的 Jev 身份是已选供应商的真实结果记录;在尚未选定第二供应商时不预先加入虚构的 provider 枚举或等价执行器。
14. 模糊产品目标与工具选择的底层职责推导(2026-09-30)
Section titled “14. 模糊产品目标与工具选择的底层职责推导(2026-09-30)”本节源码观察基线为 9813d0fc;架构推导与探索性模型结果不代表后续主线状态或 issue 验收。相关实施由现有 GitHub 工作继续推进,本文不维护其进度。
用户说“设计一个桌子”只确定了产品目标,未确定用途、空间、人数、承载、结构、尺寸、材料或制造方式。至少餐桌、书桌、茶几、壁挂折叠桌等解释允许的具体提交不同;给定同一句输入,任何算法都无法保证选出的单一几何同时满足所有真实意图。这是信息不足的下界,不是模型能力弱的偶然故障。主动推进因此先指保存有来源的目标、读取现有工程和能力、提出带可见假设的可撤销概念分支,以及询问会改变下一步动作的问题;不能把“常见桌子”尺寸或四腿结构静默提升为用户约束,更不能把一个默认草图宣称为所有桌子的安全共同提交。未知解释仍须保留开放出口,已列概念不是穷尽集合。交互白皮书
一次具体交互可以这样推进:第一轮记录用户原话为目标,标出用途和使用情境未知;读取已有工程及可用的关系/构造能力,展示“餐桌 / 工作桌 / 边桌 / 其他”的概念方向,或在候选构造成本可接受时生成隔离预览,同时问“主要用于什么、约几人、放在多大空间”。第二轮若用户说“四人用的小餐桌,先给可修改方案”,将该回答记录为有来源的要求,生成若干参数化候选,尺寸仍标为待定或明确的 AI 假设,实际检查后展示预览。若用户再要求“桌面变宽时,桌腿离外边保持原距离”,必须将这条未来编辑关系编译成可执行约束,用扰动预览和检查核对;一个 ruleBinding 字符串或 Jev 标签本身不能兑现编辑语义。用户选方案的事件由可信入口绑定身份;工程检查、模型建议和用户接受是三种不同证据。
这要求有版本的语义任务和候选探索前沿:原始观察、要求及来源、多个互斥或兼容的解释、每个解释的前提和依赖、未决问题、已读模型修订、检查证据与接受事件。探索前沿不是第二个几何模型;实际形状及可执行关系仍由单一 AMIR/几何核心权威维护。异步 Jev/LLM 结果必须绑定任务版本、模型修订、可见域、候选与问题定义;输入失效后只能重评或返回 stale。现有 DesignTaskDocument 已有观察、要求、待决项和决策日志,但只保存单个活动候选/澄清;SemanticHypothesis 可区分未来编辑含义,却尚未形成可持续的多分支原生流程。任务契约、语义契约
14.1 按信息依赖选择执行者,而不是全局选择一个工具名
Section titled “14.1 按信息依赖选择执行者,而不是全局选择一个工具名”| 当前缺口 | 合理的下一步 | Jev 的位置 |
|---|---|---|
| 意图、对象和参数已明确,能力唯一且获授权 | 代码绑定并通过原生能力执行与检查 | 通常无须新增模型调用 |
| 当前工程、引用或能力定义未知 | 原生 Interface 读取、发现、检查分页与覆盖 | 可在已召回的相关项上辅助排序,不能隐藏未召回能力 |
| 需要创造产品解释、候选结构、关系或多步程序 | 生成模型使用完整原生发现与执行路径 | 候选形成后评估有界语义问题;必要时可提前判断已有语义 |
| 已有有限且适用的解释/能力候选,文字含义难辨 | Jev 的 Choice/Noul/Score 提供判断、分布及拒判;宿主保留扩展和澄清 | 候选建议不是授权、工程 pass 或工具参数的证明 |
| 设计取舍没有可推断答案,或候选导致不同提交/未来编辑 | 展示可比较预览并向用户提问 | 可帮助找出分歧,不能制造用户偏好 |
TypeSafe 的函数调用示例针对函数与参数的已知闭集;技能推荐示例将 Jev 的结果作为 Agent 的建议,仍保留 Agent 的完整目录与判断。Aira 的 CAD 能力和目标参数需要动态发现、组合与构造。若把 Jev 放在每个工具调用前做强制总路由,缺失正确候选时会把错误召回包装为确定选择;多步计划还需生成模型和核心计算,增加一次串行调用不自动减少总成本。因此保留生成模型直接使用当前权威原生 Interface 的路径,Jev 只在已形成且覆盖可检查的局部候选集上承担明确的语义判断。Jev 也不必永远位于生成模型之后:原文已有有界对象或角色候选时,可以先判断并同时进行独立读取。调用位置由信息依赖决定,而非固定模型顺序。
14.2 真实的模糊目标探针与当前能力缺口
Section titled “14.2 真实的模糊目标探针与当前能力缺口”使用 @typesafe-ai/sdk 对三个预先写定的合成场景各调用两次,固定 jev-1.13.0、无重试、15 秒单次超时,共六个请求、2,780 输入 tokens,按官方价格估算输入费用约 $0.000117。第一次运行的 Noul 日志字段写错,仅 Choice 被正确打印;改正日志字段后原样重跑,第二次得到:仅“我想设计一个桌子”时用途 Choice 为 unknown,直接提交具体四腿餐桌的 Noul 为 0.02,用途可能改变设计的 Noul 为 0.94;“四人小餐桌、先给可修改方案”时用途为 dining,未经复核就最终提交为 0.02,请求预览为 0.96;“把现有桌子调高到 75 厘米”但未读取模型时,下一步 Choice 为 read,当前参数绑定可见的 Noul 为 0.07。这只核对 Jev 对这些已写好问题和选项的响应,不证明它能发现所有设计解释、生成桌子、校准概率或自主完成多轮任务;两个重复运行也不是独立留出。
当前公开原生操作仍缺可发现的任务读取、记录观察、提出/比较多个临时解释、澄清与可信接受的完整链路;现有语义工具的 propose/evaluate 也尚未正向接通。最小可检验纵向切片应让外部 AI 经同一原生 Interface 做一次“模糊目标 → 有来源的多方案/未决问题 → 用户补充 → 真实候选预览和关系扰动 → 版本绑定的接受或继续探索”,且通过同一权限、事务与恢复路径。公开接受操作时,actor: user 必须来自可信用户会话,不能由模型参数填写。原生操作契约、语义工具
实际策略收益仍按 #355 的 A(当前真实生成流程)、B(共享协调与同一生成模型,无 Jev)、C(B 加按依赖调用的 Jev)在独立任务和可比总预算下评价;把“设计一个桌子”、正确候选缺失、明确参数编辑、状态过期、工具召回遗漏和失败恢复分开报告。组件探针和 TypeSafe 的其他领域案例均不能证明 Aira 的任务完成率或成本改善;也不能用一次低 confidence 错误事后设定自动采纳阈值。Confidence、模型局限
15. 个人版瞬态只读评估边界与权威状态一致性推导(2026-09-30)
Section titled “15. 个人版瞬态只读评估边界与权威状态一致性推导(2026-09-30)”在个人版(Local Workbench)体系中,权威 CAD 几何(AMIR/Revision)与设计任务事实完全由浏览器本地 IndexedDB 独占持有单一权威(Single Authority),服务端不维护亦不捏造镜像任务库以杜绝双重真相与跨会话脑裂。
客户端发起的语义评估请求携带经可信会话签发的显式个人瞬态切片(Explicit Personal Ephemeral Input)。服务端网关仅验证鉴权会话、核验 visibleScope、执行严格 Schema 校验并在安全控制面完成单步预算准入审计;网关返回的判定或概率分布仅作为非权威咨询建议(Advisory Proposal),外部模型咨询绝不具备工程修改授权权,不能替代确定性几何与事务核验。
客户端在发起咨询前与收到建议后均须比对本地最新快照状态(核对当前分支 currentRevisionId 与并发 taskVersion)。若状态已发生漂移(Stale),咨询建议立即作废;若时效校验通过且意图被采纳,状态推进必须经由客户端本地原子事务 persistCommit(联合 CAS 校验 expectedHead 与 expectedTaskVersion)在单次 IndexedDB readwrite 事务中原子完成,严禁外部建议直接写入工程事实。
状态切片在剔除传输噪声的同时必须保留规范实体标识(Canonical Identity,如特征 ID 与关联引用)以保证语义消歧输入完整;多模型协同通过跨步骤的独立受控调用显式编排,严格遵循网关单步准入审计铁律。
16. 从实验到约束策略与程序结构(2026-09-30)
Section titled “16. 从实验到约束策略与程序结构(2026-09-30)”本节在 8e8900e0 上研究如何分配确定性核心、Jev、DeepSeek 和用户的职责,并决定哪些实验能改变该分工。它是实施前的推导与有针对性的测量,不授权替换运行时,也不宣称已找到所有 CAD 任务的经验最优策略。既有真实探针是探索材料;正式独立评价仍按 #355,实施机制见产品结构方案。
16.1 先定义“最佳”的条件
Section titled “16.1 先定义“最佳”的条件”正确的优化对象是预算内完成原需求、保持未来编辑含义、可恢复的整个任务。设策略为 π,需求分布为 D,总费用 C、端到端耗时 T、用户决定次数 U;只有真实独立判据通过的终态计入成功 Q,fail、unknown、超时和证据缺失均不计为 pass。
可采用“Q(π) ≥ q₀、C ≤ B、T ≤ Dₜ、U ≤ H 下最小化期望 C”的目标,或“相同资源上限下最大化 Q”。q₀、容忍界与主要目标必须在看留出结果前确定。费用、毫秒和用户负担不直接相加;若用加权目标,各项归一化、权重与取舍须公开。几何、权限、可信接受、当前契约、原子提交与历史恢复始终是动作的合法性约束,不能以省钱换取绕过。
“最佳”只相对于明确的需求分布、动作集合、可见信息、资源约束和损失成立。 当前只有一个作者设计的完整探索任务,尚不能估计 D、自动语义采纳风险或所有动作的收益。因此可以裁决责任结构、排除被支配策略、选择优先实现的机制;不能给出普遍最优的模型比例、confidence 阈值或分数提升。
16.2 条件性的最优策略与可执行近似
Section titled “16.2 条件性的最优策略与可执行近似”令 x 包含权威任务/修订绑定、尚未满足的义务、候选与来源、已经检查的事实、未决问题、剩余预算以及在途请求。h 是尚未观测的真实需求解释;b(h) 是在有效领域标注与观察模型成立时的信念。有限动作包括原生读取/计算、Jev 判断、开放生成、用户澄清、实际候选检查、提交及带原因停止。
在有限状态与期限、已知观察/转移核 K、明确终态损失 L 的前提下,可写有限时域 Bellman 递推:
V₀(x,b) = L(x,b)Vₖ(x,b) = minₐ∈Alegal(x) [ c(x,a) + Eₒ~K { Vₖ₋₁(x′, b′) } ]c 是已声明目标中的增量损失/成本,预算包含每次请求预留及已消费资源;不可行动作从 Alegal 排除,停止未完成任务的损失不能设成零来虚报完成。若并行调度,x 还须包含在途工作、完成事件、依赖和资源争用;时间按实际关键路径扣除,不能把并行分支耗时相加。该递推由按剩余步数归纳得到条件最优性;状态爆炸和未知 K 使它目前不适合作为产品里的全局求解器。
Jev 的概率/原始 confidence 不能直接填入 b、K 或错误上界。官方 confidence说明它是分布的统计量;领域正确性仍需独立标签。缺少校准时,产品近似应使用来源、缺口、明确规则、预算和保守失效;评分用于优先级。若以后获得有效的 K 不确定集合,可比较最坏风险或稳健策略,但不把无依据的集合当作保证。
从递推可得到以下可执行裁决:
- 先做必要的确定性工作。 精确数值、合法引用、权限、类型和已有结构化诊断有明确代码结果时,新增模型不能免除这些计算。相同结果与义务下,更贵且不增加有用信息的动作被支配。
- 按动作差异获取信息。 若全部仍有依据的解释在当前决策中共享同一个最小损失动作,辨别这些解释的即时信息价值为零;可以先做共同合法读取。它们未来可能分叉,不能把“下一步相同”升级成“整个任务无需澄清”。当前几何相同但未来边距/孔距不同,属于不同决策含义。
- 开放构造由生成模型承担。 正确候选未出现时,闭集 Choice 的再评分不能产生它;需要发现、扩展或生成。保留未探索出口,不能把低分候选记录为不可行。
- 已有候选的有界语义缺口才比较判断成本。 若生成调用本来必要,比较的是它顺带判断的增量费用和误差;不能把整次生成费用算作 Jev 可省掉的费用。若 Jev 能避免昂贵错误分支或独立生成轮,则比较避免的费用与新增准备、往返、误判、废弃及修复费用。
- 无法观测的偏好交用户。 对两个不同真实偏好,若全部机器可见信息具有相同条件分布,再调用模型不会提供区分信息。统计猜测不能成为用户选择事件;预览可以协助人决定。
单步信息价值的条件表达是 R(b) − Eᵧ[R(b|y)] − c_query,R 为在合法动作中的最小期望损失;只有信念、观察核和损失适用时才有数值解释。全局策略比较的是后续 V,而不只看单步熵下降。互补的两个观测可能各自零收益、合起来有收益;因此“熵最大先问”“低 confidence 就问人”“每步 Jev”不是最优性的推论。
16.3 已有实测怎样约束优先级
Section titled “16.3 已有实测怎样约束优先级”真实 Native 探针通过当前 SDK/网关/核心:一个圆板、两种初始编辑解释、脚本化可信用户选择、真实生成、尺寸扰动及正常关闭后的进程重启。四份实际 STEP(provider-off/live 各初始与编辑后)由现有 OCP 7.8.1.1 独立读取,检查实心体、圆柱外形、四个完整贯通孔、孔距、边距与解析体积。它证明该输入上的行为,不是 AI 独立选题、真实用户偏好或超长链成功率。完整证据与限制在 #366 实际验收。
| 观察量 | 已测结果 | 能支持的决定与边界 |
|---|---|---|
| DeepSeek 9 次调用 | 419,637 输入、12,930 输出 tokens;供应商响应时间合计约 59.522 s | 找出重复生成调用和上下文的来源;不是整个任务墙钟耗时。 |
| Jev 4 次调用 | 实际 jev-1.13.0,同一快照三题批处理与三次单题 |
已验证 typed 多题传输;问题是作者提供,不是自主问题发现。 |
| 新探针保守费用 | DeepSeek $0.1414071,Jev $0.000202272,总 $0.141609372 | 按锁定的峰时未命中估算,非账单;DeepSeek 占 99.86%。完全省掉这些 Jev 也只减少本次估算的 0.14%。 |
| 批处理输入 | 1,298 对单题总 3,518 tokens,少 63.10% | 支持共享状态减少该样本重复输入;不证明判断质量或总任务收益。 |
| 批处理客户端时间 | 1,286.73 ms 对顺序单题总 813.95 ms | 批处理本次更慢;固定顺序和首次连接混杂,不能推出批处理一般更慢或更快。 |
| 当前决策 Schema | 74,645 UTF-8 bytes,现有上限 80,000 | 测量来自真实 SDK 派生定义;bytes 不是 hosted tokenizer 的 tokens。 |
| 重启判据 | 完整任务、head 与编辑几何保留;生成器合法新增第三个未决解释 | 原 count==2 判据失败后用保存的实际读回透明纠正;不计为新调用或独立样本。不证明突然掉电/崩溃恢复。 |
以本次平均整轮生成估算 $0.0157119 和平均 Jev $0.000050568,仅现金、同等质量且确实能避免一整轮生成的理想盈亏点约为 P(避免一轮) > 0.00322。这不是上线阈值:已经必要的生成轮边际成本可能很小,实际缓存、额外读取、误选修复和等待会改变式子。正确性缺口未量化时,不能由低单价推出自动绑定。
费用应按 输入未命中×r_miss + 输入命中×r_hit + 输出×r_out 及各供应商规则逐次累计。复核保存的嵌套 usage 找到 DeepSeek 命中 380,672、未命中 38,965 tokens,命中率 90.71%;按本次声明的峰时费率计入缓存后,估算为 $0.029489532,仍不是供应商账单。此前累计保留预算继续使用较大的未命中估算,不因重算而释放未知费用预留。DeepSeek 缓存文档暴露命中/未命中字段且明确是尽力服务。已有胶囊保持稳定前缀、折叠旧日志、共享 $defs、分页和驱逐;对照必须保留这些机制。现行 DeepSeek 价格与 Jev 价格/限额于 2026-09-30 再核对,正式运行应记录所用费率与实际模型版本,不追改历史费用。
16.4 超长设计链需要什么程序结构
Section titled “16.4 超长设计链需要什么程序结构”推荐在现有 runStepTask 单协调器中形成按未满足义务调度的依赖图,节点可由确定性代码、Jev、生成模型或用户提供观察/提议。它是现有任务和执行路径的组织方式,不是四个各有模型权威的 Agent。持久任务/frontier、AMIR 和原生事务仍为现有唯一来源;缓存、页、队列与依赖索引均是可丢弃派生状态。
| 职责 | 应复用/演进的现有承载处 | 必须成立的语义 |
|---|---|---|
| 当前义务、解释与可信接受 | DesignTaskDocument、semantic-frontier.ts |
同一任务版本;原话、假设、工程事实与用户决定有不同来源。 |
| 需求驱动读取与有界状态 | ledger.ts、capsule-builder.ts、原生发现 |
保留要求/接受/当前绑定;缺失、驱逐及覆盖范围可见,必要信息可重新读取。 |
| 模型看到的能力 | decision-schema.ts 从 SDK 权威定义派生 |
可以研究任务相关的投影/分页,但保留开放发现与扩展;没有第二份可维护 Schema。 |
| 调度与完成 | loop.ts、DecisionSource、协调器与 trace |
明确一个请求解决的缺口、使用点、终止原因及独立完成证据;未决不冒充 done。 |
| 模型传输与计费 | 既有 step/semantic 网关与 caller | 每次尝试独立准入、预留/结算;迟到、取消、失败也计成本;模型输入不是权威备份。 |
| 计算、检查和提交 | 既有编译/候选求值/Native 事务路径 | 所有执行者汇合到同一权限、验证和适用的 task/head CAS;检查与当前上下文绑定。 |
当节点 i 的依赖 Dᵢ 完整已知,变更集合 Δ 只要求重算 Dᵢ∩Δ≠∅ 的节点及其实际受影响后继;复杂度取决于受影响闭包和结果大小,不是总历史长度。完整依赖须包含数值/单位、读取成员与不存在结论、规则与用户取舍、资源内容、可见域、运行时和检查条件。只记录被选对象的 ID 会漏掉后来新增的候选。依赖不完整时继续用整个任务/修订失效;模型建议不能替代码声明“无其他依赖”。
语义观察可复用、几何事实可复用和提交证据可复用是不同命题。跨修订复用一个观察或数值后,仍须重建当前授权、接受来源、谓词结果和证据绑定;不能复用旧提交许可。已接受历史从封存语义重放,不随模型版本重新判断。
对于 N 次有语义误差可能的决定,若每次在适用条件下有有效错误上界 εᵢ,联合界给 P(任一错) ≤ Σ εᵢ,不要求独立;未经校准的 confidence 不能充当 εᵢ。例如 1,000 次各 0.001 的上界已经无用。要求整链错误概率 ≤ δ 时需有效地分配风险,使和不超过 δ;仅把每步模型加到“99.9%”不能解决。应尽量把计算转为确定性工作,把错误在候选/未来编辑检查及可信接受处拦截,保留恢复点;几何检查覆盖不到的意图仍须独立验收。
长链若反复发送全部增长历史,输入总量可到 Θ(N²);现有有界胶囊已经避免这项简单基线。后续优化要降低实际重复状态与不必要模型轮次,并证明压缩后关键义务仍可取回。有限字节上限只约束单次输入,不保证持久存储、原生内存、模型可用性或任务成功。全局约束和未知读取依赖可能使变更闭包覆盖全图,不能宣称普遍 O(1) 编辑。
同一授权状态切片、答案不相互依赖的 Jev 问题可合批;需要先前答案的问题按依赖分波。官方 fan-out支持同请求的多题求值,不保证统计独立或 Aira 整链恒定延迟。相互独立的必要读取/生成/建议可重叠;建议在使用点前没到达时,策略明确等待、丢弃或继续合法工作。当前共享模型的写入仍通过单一事务结算。
16.5 关键实验必须能改变一个决定
Section titled “16.5 关键实验必须能改变一个决定”下面定义的是机制判别与停止规则;正式 campaign 的实际样本量、seed、费用和模型锁定统一放在 #355/#356。探索结果不得事后选一个最有利分支作为部署策略。
| 假设 / 要选择的结构 | 最小的控制变量与观察 | 会改变方案的结果 |
|---|---|---|
| 额外 Jev 判断能省去工作 / 在必要生成轮内顺带判断 | 固定独立来源语义与已有候选;生成必要/不必要分层;B 与 C 使用同一 executor、同等可见信息与总预算,统计避免的真实轮次、错误分支、返工、费用和终态 | 省下工作不足以抵偿新增成本,或错误强选恶化,则缩小/停用该调用位置;不能以 Jev 单价低替代。 |
| Schema 或实际工作状态是主要输入成本 / 先改哪一个 | 锁定真实 SDK 派生 Schema,拆分 provider wire 的 schema、capsule、round log;分别变 Schema 投影或页数/历史长度,观察字节、真实 usage 与缓存 | 只优先实现有证据的主项;页驱逐丢失关键义务则拒绝该压缩。没有原始 wire/缓存字段时 token 归因 unknown。 |
| 合批改善时间 / 按共享状态分组 | 同一快照与问题;冷连接单列、预热后交错顺序的 batch/serial,固定并发/超时,保留所有失败与成本 | 若只降输入而不降关键路径,收益只表述为费用;依赖问题不能合批。没有重复测量不发表 p95。 |
| 局部依赖可安全复用 / 继续整任务失效 | 分别改无关字段、相关规则、仅任务偏好、新增查询成员、由不存在变存在、可见域;延迟答复和重启后核验相同请求/证据绑定 | 任一错误复用先拒绝该域的跨版本复用;保守重算是代价而非错误通过。覆盖未知保留整体失效。 |
| 同形候选具有不同未来语义 / 必须澄清的位置 | 需求判据独立于施工顺序;当前形状相同,但后续尺寸扰动要求不同;候选缺正确项/冲突要求同组报告 | 能画出当前形状而未来关系错仍为 fail;需要真实用户取舍时,增加模型轮数不能替代澄清。 |
| 长链完成与恢复改善 / 按义务调度而非全量重试 | 固定依赖拓扑与深度、同输入连续编辑/撤销/重开;独立来源规则及最终状态判据,比较受影响闭包、额外模型轮数、耗时与可见内存 | 丢失接受来源、旧规则重解释或 unknown 完成即拒绝;超出已测深度/设备范围保持 unknown。 |
先验证接口/身份/输入覆盖等硬前提,再做只改变一个机制的组件或 Native 对照,最后冻结一个可执行策略做独立完整任务比较。每次运行必须写明若出现哪种结果会改选或停止;不能在结果不支持时无目的添加更多 CAD 例子。
统计力度按主张决定。例如独立同分布来源组、固定策略、零次错误的 n 个二项观测,一侧 95% 错误率上界为 1−0.05^(1/n);要低于 1% 至少约 299 组。此公式的假设不适用于一个任务的多题/重排/重复调用;也不保证分布漂移后的表现。若只做少量辨别性探针,就只报告观察与反例,不伪造上线风险证书或泛化分数。
16.6 本轮针对性实验与复核结果
Section titled “16.6 本轮针对性实验与复核结果”三路 Antigravity worker 分别处理策略、成本和一致性;两次额外 worker 复核修正了超出证据的推导。所有原始材料在忽略的 scratch/strategy-*;下表是可由源码、命令或保存的真实 usage 核对的结论,非新的评分报告体系。根协调器重放了修正后的有限决策枚举、生产 helper 探针,并独立执行成本与 Schema 测量。
| 问题 | 实际方法与结果 | 裁决 |
|---|---|---|
| “每步判断”“总用生成模型”“按熵路由”是否可推导为最优 | 五个明确有限损失/信号例子;无信息信号增加费用;相同条件质量下更贵生成被支配;同一 [0.88,0.12] 信念在不同损失下选择不同动作;XOR 两信号单独无信息、联合可决定;额外 Jev 在假设能减少错误分支时可改善必要生成的总损失 |
排除这些无条件策略。概率、损失和现金换算权重是合成条件,数字不作为 CAD 成功率/收益。枚举只验证这些有限树,未实现全局 CAD Bellman 求解器。 |
| 改小 Schema 能否真的减少 provider tokens | 原生 SDK 权威 Schema 仅机械选取 aira_semantic_assessment 的既有输入分支及名字,保留原顶层 read/batch 定义:74,645 → 55,651 bytes;通过现有 DeepSeek caller 发两次请求,完全相同 message 哈希,输入 19,218 → 13,475 tokens,少 5,743(29.88%) |
该受控组件输入的 token 降幅已测;没有资格声称相同能力覆盖、建模质量或整任务收益。未替换产品 Schema。 |
| 新切片的缓存代价是否可能抵消 token 节省 | 第一对完整/切片命中分别为 18,944/128;保持 message 和 parameters 哈希完全相同再调用一次切片,输入仍 13,475,命中升到 13,312 | 需要保留稳定的任务/阶段能力投影,比较初始化与复用成本;不支持每步任意重造 Schema。单次重复不证明缓存 SLA,也未隔离所有冷暖因素。 |
| 旧历史是否仍线性撑大 capsule | 用真实 TaskLedger/buildCapsule,固定意图/summary、无工作页,合成 commit 数 0/12/100/1,000/10,000,胶囊依次 13,476/14,094/14,165/14,193/14,221 bytes;ledger 段 92/710/781/809/837 bytes |
现有折叠在该输入阶梯已有效;优先检查真实 round log 和调用需求。不是 10,000 次 Native 编辑、JS/WASM 内存或持续会话验收。 |
| round log 是否值得单独测量 | 保存的真实九步 host trace:capsule 始终 15,562 bytes;log 从 0 增至 131,153 bytes,第二步已 66,289;最终 host prompt 146,715 bytes | 不把“大胶囊”当唯一瓶颈;分开测 Schema、稳定 capsule 与 log。host 字节不是 provider wire 或逐段 tokenizer 分配,token 占比及所谓“第六步交叉点”未证实。 |
| 已接受选择是丢失还是失去当前绑定 | 直接调用生产 syncDesignTaskRevision 与 TaskLedger.updateTaskContextFromDoc:受控 rev-0 → rev-1 后原 activeClarification 和 decisionLog 保留,acceptedClarification 投影字段不再出现;adopted hypothesis 仍投影但标 stale;直接跨修订采用被拒绝 |
存储未在此 probe 丢失选择;研究历史决定的有来源投影与当前适用性分离。不能仅凭祖先关系放宽写入、自动 rebase 或修复 head 分歧。 |
| 局部依赖/恢复是否已证明 | 生产 helper 的旧任务版本拒绝、rebase 新身份及相同调用者 hash 下 ledger 页标志已测;几何依赖闭包、实际 refetch、成员/不存在失效、late controller 并发和崩溃恢复没有在这些 helper 探针中执行 | 保留整体失效。模拟比较/JSON 序列化不作为 Native CAS、Worker、IndexedDB 或崩溃证明;正常重启证据只引用此前真实 Native 探针。 |
真实 Schema 组件调用使用 deepseek-flash,实际返回同名及相同 fingerprint aeb56401ca74e127821c4f9126dcb669;Node 26.7.0、AI SDK 7.0.91、DeepSeek adapter 3.0.39,实际载入的 dist 与测量 bundle 哈希保存在原始输出。它们直达现有 provider caller 的组件边界,没有经过 Native CAD 或 HTTP 会话资格验证;只发作者写定的短英文测量输入,不含用户工程或几何操作。两次主比较预先固定完整→切片顺序;第三次为观察新切片的冷暖差异而追加、原始主比较保留。每次一次尝试、无重试、45 s deadline、256 输出 tokens,三个响应均 finishReason=length、只产出 reasoning、未形成合法完整决定。因此:输入量与缓存计数有证据;语义/工具决定完成为 fail,设计质量和任务完成率为 unknown,不能将三次 HTTP 响应称为模型通过。
按峰时 r_miss=$0.30/M、r_hit=$0.006/M、r_out=$1.20/M,三次 usage 费用分别估算 $0.000503064、$0.004312068、$0.000435972;最初新切片比暖完整 Schema 更贵,重复后更低。它们是不同缓存状态下的组件估算,不是公平冷暖条件的最终策略比较或供应商账单。若缩小后每个阶段都重新丢掉缓存,输入降幅可能被初始化成本抵消。
可以用条件性摊销式表达这一取舍:固定完整投影每轮费用 f,切片首轮费用 s₀、随后稳定每轮 s₁,在其他工作/质量/缓存条件都不变且 f>s₁ 时,k 轮选择切片更省费用当且仅当 k(f−s₁)>s₀−s₁。如果能力扩展、模型切换、前缀变化或缓存失效发生,要重新计初始化成本。本次只有一次重复,不能将式中的常数外推为部署阈值;有用能力和正确性仍优先于凑缓存次数。
本轮新增三次 DeepSeek 保守未命中预留结算共 $0.014772,累计保留 $0.876893026 仍在原 $5 上限内;原分配已用满 12 次 DeepSeek / 4 次 Jev,不追加未授权额度。缓存费率重估不改累计 cap。这里没有独立留出任务、自主评分改善或上线 confidence 阈值。
复核明确拒绝:用假设 4.1 bytes/token 声称节省 109,629 tokens 或整任务 23.3% 费用;删除 batch 参数描述却称等价去重;没有完整依赖见证却称“100% 错误失效”;仅检查 ledger 标志却称“零 CAD refetch”;从 hash/rebase 或 JSON round-trip 推出几何/并发/持久化正确。这些结果不进入策略收益结论。
16.7 能力投影、意图连续性与真实组件复核(2026-09-30)
Section titled “16.7 能力投影、意图连续性与真实组件复核(2026-09-30)”本批在同一 Native 权威/执行器内实现 aira.step/0.4.0 的机械能力投影与有来源意图。持久化 DesignTask 仍为 0.2.0,CAD catalog/AMIR、几何、权限、当前 head CAS 和历史解释没有改变。默认展开语义协作与持久化恢复两个 SDK 工具;固定索引包含全部十个工具的权威名称和短描述。默认 library scope 的精确工具名 lookup 将该工具加入本任务投影,下一请求从同一 SDK 定义展开完整输入 Schema;混合查询仍执行正常 library lookup。扩展按权威顺序去重,本任务内保留;未发现调用被拒绝并给出 lookup 恢复方式,不执行隐藏工具。顶层 read/batch 参数未删减。Native operation catalog 不被假定包含 SDK 工具,也没有第二份工具定义或执行器。
历史选择只投影当前 resolved clarification 对应的最新决定及其选项/假设绑定;须有 user actor、匹配选项、相同 task、假设与源决定 revision 一致。保留 event ID、源 task/revision、规则和假设状态;后续修订标为 historical,use=intent-guidance。相同 head 且假设 adopted 才保留原 acceptedClarification。该模型可见投影不是写权限;仅 actor 字段不能证明任意外部输入可信,实际来源仍是受保护的 Native 持久化路径。被替换的 clarification 定义没有完整历史存储,不能从仅含 option ID 的旧事件编造全部旧规则。投影最多带一个相关选择、八个 hypothesis,以及八个当前 fail/unknown requirement 的 id/kind/title/status、遗漏数和完整状态计数。任务整体失效规则不变。轮内保持 capsule 前缀,变化后的 taskContext 随结果进入 log;下一轮从当前状态重建。
三路 Antigravity worker 产出初稿,根协调器修正并实接。worker 的错误 API 字段、无效 requirement 状态、过强费用推断和伪留出划分没有进入验收。所有作者题目已被根协调器检查,统一算探索;没有独立留出。#355 的调用前冻结记录规定 12 个需求组、每组中英配对、每个 provider 最多 24 次、输出上限 2,048 tokens、45 s deadline、零重试和并发最多二。需求组覆盖固定边距/固定孔距、同形不同未来编辑、缺正确候选、缺用户偏好、明确几何冲突与实体角色。冲突判据要求完整封闭孔/侧壁,不能把单纯超大盲孔布尔切削误称为几何不可能。题目不给正确选项结论,oracle 由需求写定,独立于 CAD 施工序列;题目简单且作者选择偏差仍存在。
| 测量边界 | 实际观察 | 结论与限制 |
|---|---|---|
| 当前 SDK Schema 的结构与 provider 输入 | 完整/默认分别 74,645/56,294 UTF-8 bytes(−24.58%);同 message 哈希三次完整/默认/重复默认输入 19,154/13,540/13,540 tokens(前两项−29.31%)。缓存命中 18,944/13,312/13,312;输出 489/691/158 tokens | 输入减少在此组件已测;输出波动能抵消部分费用改善,前两次返回合法 abstain、第三次 done,均非 CAD 验收。峰时缓存费用估计 $0.000763464/$0.000977472/$0.000337872,不能从 token 降幅推出固定费用降幅。 |
| 独立判断组件,production caller,无 CAD session | DeepSeek 24/24 与 Jev 24/24 判断符合探索 oracle;fail/unknown 均 0。24 次是 12 组双语,不能视作 24 个独立来源组。DeepSeek 输入 331,953(hit 309,376/miss 22,577),输出 3,676(reasoning 2,106);Jev 输入 18,362、输出 1,248 | Jev 峰时费用估计 $0.000771204;DeepSeek 按实测 hit/miss 为 $0.013040556,未命中保守结算 $0.103997100。DeepSeek 带当前 SDK Schema,Jev 用自身 Choice 接口。不是必要生成轮的边际费用比较,不是任务成功率或校准结果。 |
| 原生连续性/发现,provider-off | 旧构建基线 22 项通过;当前构建 24 项通过,包括真实 task 的历史选择投影、未发现 BOM 调用拒绝、混合 lookup 扩展后同一 SDK BOM 执行、参数编辑和正常浏览器进程重启。另 11 项根协调器 helper 核验包括源绑定、latest-event、失效状态、Schema 不变量及 residual cap | 同一真实 Native task 输入的新旧 helper 对照证实原投影遗漏而存储未丢失。故意损坏 helper 输入不是成功伪造 Native 写入;deterministic source 通过不是 AI 自主发现。 |
| 真实生成与语义表述修正 | 初稿 requiresRevalidation=true 与提交后 notice 被模型解释为额外语义评估:几何已正确,12 轮仍未结束(一次输出截断,后续多轮读取/提议/评估);记录为 fail。将产品投影改为历史 intent guidance、明确不生成强制模型评估义务,同需求/12 轮预算复跑在 4 轮结束,24 项 Native 检查通过 |
两次各一例、随机模型且前缀改变,不能声称总体 3× 提速或纯因果收益。失败记录保留;历史指导与进一步写入验证分开,没有放宽 stale/CAS 或用 Jev confidence 授权。 |
| 独立几何回读 | 当前真实生成 STEP 初始 R40/pitch30 与参数编辑后 R50/pitch40,OCP 7.8.1.1 判据均通过:有效实体、完整贯通四孔、半径/角度、外圆、厚度、体积及 7.5 mm 边距 | 成熟 OCCT 独立读回,线性容差 0.001 mm、角度 0.5°;只覆盖这一个 authored 圆板任务及编辑。用户选项是受信 controller 脚本选择,不是模型推测到用户偏好。正常重启不代表断电/崩溃恢复。 |
原始组件判分脚本把不存在的 selectedCandidateId 当作 Jev 答案字段,造成十二个 unknown;实际生产字段为 candidateId。另一个 DeepSeek act=abstain 与目标 done.summary=__abstain 表达相同弃权。根协调器对保存的合法响应重新判分,保留原始记录和更正理由,没有重新调用、重生成或调 prompt。不能把修正前的脚本 unknown 当作模型失败,也不能隐藏它。
条件性费用推导。 此探索组件的缓存峰时均费为 c_D=$0.0005433565、c_J=$0.0000321335,比值约 16.91;这包含不同接口开销,不能推广到所有模型任务。仅在同等正确性、Jev 以概率 p 避免一个完整同类 DeepSeek 调用、没有额外返工/等待费用时,现金改善条件是 p*c_D>c_J,即本组件估计 p>5.91%。p 尚未测,不能部署此阈值。如果 generator 本来仍须生成,比较应是 c_J + Δc_generation + Δc_repair 与错误损失的变化,不能用一个完整 generation 轮的费用假装边际收益。确定性已有事实不需要额外模型判断;缺候选先扩展,缺偏好请求用户;Jev 在有资格的独立有限判断上有低费用证据,必要生成内判断与额外 Jev 的总预算比较仍由 #355 验证。自动 pre-turn Jev 路由、confidence 风险门槛、完整依赖选择性复用和超长链验收尚未由本数据证明。
本批实发 43 次 DeepSeek、33 次 Jev,包括组件、三次 Schema 请求以及两个 Native pilot;没有隐式重试,所有预算租约结算。新增峰时未命中保守结算 $0.352012020,加原保留 $0.876893026,累计 $1.228905046;新增授权上限 $25、累计上限 $25.876893026。旧账未重置,缓存重估不降低保留数。这是 usage 估计而非供应商账单。原始输出位于忽略的 scratch/cooperation-*,无法从确定性源码重新推得的模型观察保存在此研究;不建立新的报告树。构建、全 workspace typecheck、受影响 ESLint、真实 Native 操作和上述 STEP 回读通过;未据此关闭 #355/#356/#365/#366 的更广验收。
16.8 必要生成轮与一次 Jev 建议的有限闭环观察(2026-10-01)
Section titled “16.8 必要生成轮与一次 Jev 建议的有限闭环观察(2026-10-01)”本批以 d033617e 为基线,通过当前原生 runStepTask、SDK 能力和执行/权限/事务路径,比较 B(必要的 DeepSeek 生成)与 C(相同生成器加一次 Jev 建议)。两者先执行相同的受控语义读取,C 再执行一次受控 evaluate;这不测模型自主选择何时调用 Jev。建议进入原生 StepLog,不修改用户意图或成为几何证据。初始需求要求命名可变尺寸、当前 solid/bounds 验证和后续保持程序/特征身份;后续修改需求和澄清答复在对应阶段才提供。Oracle、解析体积和最终尺寸不进入初始模型输入。
协议 aira.closed-loop-protocol/1.1.2,SHA256 b827f6756695054d57ea8e13adc01b35bf15f8771a71e3da10cf46c4d4fa924e。六组 authored 需求只有两种相关几何模板,含两组 calibration、四组 evaluation;根协调器在调用前审阅全部输入,独立来源族留出样本为零。交换候选位置和改变尺寸不能使它们成为独立留出。每组每臂最多 12 次生成请求,跨初始/澄清/修改共享;最多两次修复,每请求输出最多 4096 tokens、60 秒,总费用预留上限 $0.50,本批 $6。预留在请求前持久化,跨进程保留组/臂、调用和结算记录,缺失用量保留全部预留额,没有隐式重试。
供应商实际身份记录为 DeepSeek deepseek-flash,所有成功响应的 fingerprint 为 aeb56401ca74e127821c4f9126dcb669;Jev 固定并实际返回 jev-1.13.0。B 的 CAL-01 首次供应商请求在 thinking 模式返回 HTTP 400:受控原生工具历史没有模型 reasoning,SDK 省略了 reasoning_content。继续复用锁定的 @ai-sdk/deepseek@3.0.39 / ai@7.0.91;已核对其实际序列化缺少无 reasoning 的字段,修复在已有 DeepSeek wire shaping 处为这类 assistant 历史提供空字段,已有非空 reasoning 原样传回,不伪造 reasoning、不关闭 thinking;删除被替换函数名,不保留兼容别名。真实 SDK 注入 fetch 核验及后续真实模型任务通过,失败请求保留,未重试该组 B。另一次供应商调用前的驱动错误不算模型调用。
| 需求组 | B 全生命周期 | C 全生命周期 | 限制或失败证据 |
|---|---|---|---|
| CAL-01:24×16×80 导轨,修改长度 120 | unknown | pass | B 供应商 400;C 10 次生成,保留程序/参数身份及正常浏览器进程恢复 |
| CAL-02:R8×35 销,修改长度 45 | pass | unknown | B 10 次生成;C 的初始完成回复被额外 token ceiling 中止,未执行后续修改 |
| HELD-01:36×36 柱且 X≤30 的矛盾需求 | unknown;澄清子阶段 pass | fail | B 持久化可操作澄清、保持零几何并明确 abstain,但驱动错误要求 done 专用结算字段,未提供后续用户答复;C 在未获答复时提交 30×30 几何 |
| HELD-02:R15、长度 50、关于 Z=0 对称,改为 70 | unknown | pass | B 被额外 token ceiling 中止;C 11 次生成完成 |
| HELD-03:75×45×10 检验底座,厚度改为 16 | unknown | pass | B 被额外 token ceiling 中止;C 用完 12 次生成并完成 |
| HELD-04:无倒角 R5×60 芯轴,半径改为 4 | unknown | unknown | 两臂均被额外 token ceiling 中止 |
四条实际完成的链(B 一条、C 三条)均通过当前 Native solid/bounds/面数、参数和程序身份检查及正常浏览器进程重启后的 head/task/model 对照。对应初始和修改后 8/8 STEP 由 OCP 7.8.1.1 独立回读,通过有效 BRep、单 solid/shell、需求导出的体积、包围盒、平面位置或圆柱轴/半径/端面检查。体积相对误差界 1e-4,长度界 0.05 mm。只覆盖声明的轴对齐长方体和 Z 向均匀圆柱;独立读取仍共享 OCCT 算法,正常关闭重启不证明崩溃/断电恢复。此前 24/24 provider-off STEP 是确定性构造机制检查,不是 AI 成功率。
资格限制与判分修正。 驱动额外设置每个 runStepTask 的输入上限 400,000、总 token 上限 404,096,冻结协议没有声明这些额外限制。CAL-02-C 在输入 410,247、输出 8,161、总 418,408 时停止;保守未命中生成费用只有 $0.1328673,仍小于 $0.50。六次此类停止在实际 Native 运行中是 budgetExhausted,不能抹去;它们不能用于判断较宽冻结费用协议下模型会成功或失败。表中 unknown 指后者未完成验收,不把中止当通过。B 的矛盾需求已产生真实可操作澄清,不能因为模型用了 abstain 而非 done 专用 outcome 字段误判为需求失败;但未执行的续建/修改/恢复仍 unknown。C 的矛盾需求已发生明确的需求违反,后来的 token 中止不能将其改为 unknown。原始记录及更正原因均保留。
Jev 六次有限判断中五次与 authored oracle 相符;矛盾需求仍选择 cand_C(confidence 0.53、概率 0.65、__abstain 0.10),而所有候选均不满足联合条件。生成器随后认定安装边界优先于名义尺寸,在澄清尚未确认时建模。单个反例足以否定“加一个 Choice 就自动保证澄清正确”,不足以估计泛化失败率或部署 confidence 阈值。该生成器的澄清还把文字规则填入 ruleBinding,原生 host 接受后用户无法选择;修复使新澄清只能绑定当前 task/head 下已有且 unresolved 的 hypothesisId,并在同一 SDK Schema 中公开此义务。真实 Native 相同功能输入前后对照证实 prose/unknown/stale/resolved 绑定从可持久化改为拒绝且任务/head 不变;有效绑定、受信选择、只读权限拒绝和存储重开仍通过(修复后 7/7)。没有重写历史 Revision,也没有对旧的无效待确认选项作兼容解释;该修复不建立未回答澄清的几何提交屏障,此问题仍需明确提交语义与依赖范围。修复后的 AI 行为尚未重新测量。
费用与推导。 本批实发 99 次 DeepSeek(含一次无用量 400)和 6 次 Jev,新增保留 $1.768829540;累计保留 $2.997734586,剩余累计授权 $22.879158440,所有租约结算。98 个成功 DeepSeek 响应保留实际 input/output/cache/reasoning 用量。保留数按峰时未命中单价上界结算,未知请求保留 $0.35,不因缓存重估降低原保留数;供应商账单未核对。六组每臂只执行一次有供应商请求的尝试;已用于诊断的输入只能用于修复对照,不能继续作独立留出。
当前 resolveBudget 把费用上限折成最贵 token 单价:T≤B/max(p_in,p_out);这是安全但保守的半空间。只提高输入/总 token 配置,仍会折回 416,666,不能解决问题。若未来采用加权费用约束,并保留请求前持久化预留及未知用量策略,已知 token 下的边界是 p_in*I+p_out*O+c_J≤B;12×4096 输出在峰时最多 $0.0589824,忽略 Jev 时可给输入的矩形上界为 floor(($0.50−$0.0589824)/$0.0000003)=1,470,058。它是条件性安全上界,不能直接绕过现有折算、跨阶段合计和请求预留,也不能证明这批中止链会在剩余轮数完成。
必要生成仍然存在时,Jev 的边际费用判据是 c_J+Δc_generation+Δc_repair,并先满足相同正确性/恢复义务;不能把一个完整生成轮费用算成自动节省。此次没有完整、同等验收且未受额外限制影响的有效 B/C 成对完成样本,无法据此求出经验最优组合或声称分数提升。有限候选不覆盖全部可行方案;若联合条件使全部候选不适用,就必须扩展候选或请求有权改变条件的用户,不能把最近似候选当满足条件。确定性事实继续由核心承担,开放生成由生成器承担,Jev 在有资格的有限语义判断上提供可撤回建议;本数据支持保留此责任分工,拒绝默认强制每轮 Jev。
原始协议、来源上下文、回复、失败 trace、结算、STEP 和独立判定保存在被忽略的 scratch/closed-loop-* 与 scratch/clarification-binding-*;开发验收与后续范围以 #355、#365、#366、#356 为准,不据这批探索关闭它们。
16.9 已复现失败的产品修复与有限复跑(2026-10-01)
Section titled “16.9 已复现失败的产品修复与有限复跑(2026-10-01)”本轮从 e9ccb2be 出发,由 Antigravity worker 分工实现预算和提交约束、准备对照、核对供应商预留上界,并独立审查源码与实际 STEP;根协调器审查并修正了 worker 产物,执行真实 Native 验证与付费调用。worker 自报完成不等于产品验收:合成存储中的历史头不作为真实几何撤销/重做证据,provider-off 通过不计自主模型完成率。
失败改变什么判断。 一个违反明确需求的反例足以否定“该策略在这个输入保证正确”,却不能逻辑推出所有 Jev/生成器协作结构都不合理。另一方面,几何有效不能掩盖未经用户决定的需求取舍。未知不是成功,也不是已证无解;需要先分清实际需求失败、明确预算内未完成和缺少检查证据。由本轮证据保留的结构是确定性事实/几何检查、必要开放生成、有资格的有限语义建议、可信用户取舍和共享原生事务;不将模型 confidence 作为写入许可。
| 已复现问题 | 当前实现与验收 |
|---|---|
| 当前头上已持久化关键澄清,仍能提交下游模型 | semantic-frontier 提供同一判据,Native/UI 提供结构化诊断;persistCommit 在读取 head/task 的同一 IndexedDB 事务中检查持久任务与传入任务,阻止用传入 doc 清除等待。只约束 actionable 且 affectsDownstreamAction=true 的当前头澄清。受信选择后正常建模、非关键澄清与既有历史导航仍可执行。实际 Native 核验原子拒绝、选择后建模、撤销与重做恢复;不是强制所有候选必须用户选择。 |
| 以较贵输出单价把美元预算折叠为总 token 上限,输入占主导时提前终止 | 保留独立输入/输出/总量上限,并按 (I*r_in+O*r_out)/10^6 检查已知用量。CAL-02-C 已记录的 410,247 输入/8,161 输出按峰时费率仅 $0.1328673,不再因约 416,666 总 token 的折叠上限阻断;显式更低输入限额仍拒绝。该检查是用量上限,付费请求仍需网关提前预留。 |
| 初始、澄清续行、编辑分别重启预算/修复计数 | 同一任务续行可携带原始累计用量与修复次数;先检查非负安全数值,再重算总量/费用。解析拒绝和被拒绝的 done 也耗用修复额度。跨 bundle 的既有结构化错误码保留为真实诊断,不能把预算拒绝误计基础设施 unknown。实际 Native 11/11 预算检查通过,含连续累计、未知用量拒绝、显式限额、超预算、耗尽修复和跨 bundle 类实例。 |
| 成功持久化关键澄清后仍继续请求模型,反复尝试被拒绝的提交或等待 note | 在尚未应用编辑/导出时,成功的 canonical 关键澄清立即经既有 authoritative task/head/version/完整记录验证,投影 awaiting-user;不需要再付一次请求让模型说 abstain/done。不伪造用户选项或放宽权限;非关键澄清仍继续。相同实际 Native 输入,关键澄清从两次 propose、clarify、abstain 的四次 source 调用变为三次;只证明省掉等待调用。最新澄清/历史检查 10/10 通过。 |
费用与协议更正。 第一条修复诊断在 1.2.0 下正确完成初始 rail 几何,但因下一次 $0.35 预留无法装入 $0.50 组预算而停止,保留为预算策略 fail:10 次 DeepSeek,保守结算 $0.151542600,编辑未验证。历史费用不反向降低。随后核对官方定价、completion 契约及锁定 SDK:在文档 1M context 不超过 2^20、max_tokens=4096 限制全部 generated tokens 包括 thinking、固定峰时 cache-miss/output 价格的条件下,上界 1,048,576*300+4,096*1,200=319,488,000 nano-USD,向上预留 $0.32。文档/价格变化或输出限额变化须重新核对;不能用字节/token 经验比值代替硬界。更紧的预留仍会在已知费用超过约 $0.18 时保守拒绝下一请求,不能据此声称没有提前终止或已获最佳预算利用率。
1.2.1 的 CAL-01 对照保留 B fail/C pass:B 一开始提出了不必要的关键澄清,之后继续 10 次生成请求,费用 $0.197436,空模型在正常进程重启后保持一致;C 使用一次受控 Jev 建议并在 11 次生成请求中完成初始/编辑/恢复,费用 $0.129777882,两个 STEP 读回通过。发现共同调度缺陷后停止该源码批次,修复上述立即等待,再冻结 1.2.2 执行剩余十条链,未重新跑 CAL-01 或覆盖失败。
原始协议 SHA-256 分别为 1.2.0 a80613a27fac02816fe7ab4320f215e1f10dde8225e181ee1323523f0f5852a3、1.2.1 9f69e06192a816f9ec8e0a0730fc5ecd584e57eb1570fc8fa1a0b1c11c5f7cff、1.2.2 710ecff7acc6e932fdc5f062466676dabf70045f85a41eae30eb21ab3ad0eaa1;均在各自付费调用前冻结,前份保留不覆盖。设计需求、共同交付约束、后续编辑和解析几何判据沿用六个旧 authored 输入;独立留出仍为零。模型身份、实际载入代码哈希、累计已知/未知费用、失败、部分状态和正常进程重启均保存在忽略的原始输出中。每条链最多 12 次实际生成请求、两次修复、49,152 总输出、4,096/请求、60 秒/请求、$0.50;受控零 provider 前置读取/评估不占该生成调用额度,原生初始步上限为 B13/C14。浏览器整体 watchdog 明示为 1,080,000ms。B/C 同一源码 epoch 内才作配对,跨源码批次不合成单一公平成功率。
完成、几何和模型判断须分开。 冲突需求的 B/C 都先持久化有效澄清、保持空头,再接受受控真实用户取舍,未再次出现旧批次“澄清前直接改需求建模”的失败。B 随后已生成正确36×36×90几何(实际 partial STEP 独立读回通过),但一次输出截断以及投影读取的 EXACT_PRODUCT_QUERY_BINDING_MISMATCH 消耗修复额度,完整编辑链失败。C 的初始和修改后几何分别116640/142560,修改 plan 已提交;12次实际生成请求耗尽,模型没有完成 done,完整协议仍判 fail,partial STEP/身份/恢复单独核对。不能将缺少 done 的完整协议失败写成几何错误,也不能把部分工件正确自动升级为全流程通过。Jev 在冲突组又强选 cand_A而非 __abstain(confidence0.3),生成器仍自行识别冲突;这继续排除模型 confidence替代用户取舍或确定性要求验证。
| 同一 1.2.2 源码批次 | B 完整链 | C 完整链 |
|---|---|---|
| CAL-02:R8×35 → 长度45 | pass,12次生成,$0.167479500 | pass,11次生成+1 Jev,$0.127175424 |
| HELD-01:矛盾需求 → 可信放宽 maxX 后36×36×90 → H110 | fail,9次生成,$0.158743800;初始 partial 几何正确,编辑未执行 | fail,12次生成+1 Jev,$0.181974708;初始/修改 partial 几何正确,完整交付未结束 |
| HELD-02:R15、关于Z=0对称,长度50 → 70 | pass,10次生成,$0.148238700 | pass,12次生成+1 Jev,$0.179118378 |
| HELD-03:75×45×10 → 厚度16 | pass,12次生成,$0.151475700 | pass,12次生成+1 Jev,$0.155610834 |
| HELD-04:R5×60 → R4 | pass,12次生成,$0.146638800 | pass,8次生成+1 Jev,$0.081009594 |
同一 1.2.2 源码的五个相关 authored 组,B/C各4/5完整通过、各55次生成;C多5次Jev。保守未命中费用B为$0.772576500、C为$0.724888938,C观察值低约6.17%。仅有五个相关来源组、随机生成路径不同、没有独立留出或缓存控制,不支持因果费用收益、普遍优越性、调用数改善或部署默认阈值;不得按任务事后选择较省的一臂。这里的“HELD”是沿用的组名,不代表独立留出。
全修复 campaign 三个源码批次共13条唯一尝试:9 pass、4 fail、0 unknown;不能将其合并为同一公平策略成功率。1.2.2单独为8 pass、2 fail、0 unknown;原1.1.2的unknown/失败继续保留。九条完整通过链的18份初始/修改STEP均经OCP7.8.1.1回读通过;另4份正确partial工件不升格为完整pass。判据沿用体积相对误差1e-4、长度0.05mm及现有solid/shell、圆柱轴/半径/端面或长方体平面检查。独立文件读回仍共享OCCT算法,只涵盖已声明的两类几何模板;正常浏览器进程重启不是崩溃/断电证明。完整通过链均核验同一程序/节点/参数身份和实际head/task/model恢复;HELD-01-C仅partial修改的身份与恢复有证据,B未做后续编辑。
独立worker报告中的“B澄清后从未提交”“C选cand_A后未经澄清建模”及C重启head的摘要错误,已由协调器依据实际canonical task/可信选择事件/初始和abort状态更正;原worker摘要单独保留,数值几何判分未变。真实受信选择分别为B opt-square-36、C opt_B,均对应名义36;C错误Jev建议并未成为实际用户取舍。仅HTTP或worker自报成功不足以作为验收。
本轮新增141次DeepSeek、6次Jev,包含诊断和被停止的源码批次;保守峰时未命中结算 $1.976221920,在修复总cap$4内。累计保留 $4.973956506,累计请求283次DeepSeek/45次Jev,剩余累计授权 $20.902936520,无未结算租约;不是供应商账单。没有为提高分数追加随机重试或放宽既定链预算。较紧的安全预留与已知加权成本仍是不同约束,不声称已获得全局最佳预算策略。
最终产品诊断与生命周期修复。 缺少产品结构时,projection/distance曾静默省略输出,随后严格结果绑定报 EXACT_INTERFACE_RESULT_INVALID / EXACT_PRODUCT_QUERY_BINDING_MISMATCH;现在直接给可恢复 EXACT_PRODUCT_UNAVAILABLE,说明已有 set-product 的根零件/装配前置条件或standalone的faces/edges/bounds读取方式。缺失drawing返回既有not-found诊断。没有替非空实体制造空路径/零包围盒,没有削弱revision/product-hash/camera绑定,也未新增第二个投影算法。worker初版报告中的手写before摘要被协调器拒绝作为实测证据,原份保留。协调器通过Vite只固定 product-reads.ts 为 e9ccb2be 的源码、其他代码保持当前,实际重放36×36×90和相同camera,复现三个旧绑定错误;固定模块SHA-256为 f1a1047346cd2d1ade858aa1d19317718df13bbb1c847a4e550140d1231464a8。当前源码同输入8/8检查通过:拒绝读取后实际持久head/task及体积116640不变,真实set-product后返回非空OCCT路径、约±18的二维bounds及精确当前绑定。
晚到的canonical关键澄清在早期读取之后、同一持久化事务开始之前获胜时,持久守卫已正确拒绝,但恢复持久头会清空staging;factory只判断head相等,又丢弃同一候选,SDK finally的清理异常覆盖原拒绝。初版probe吞掉 CANDIDATE_NOT_STAGED,不能作为完整Native验收;协调器要求worker删除该补丁、保留并复现真实失败,然后修正产品。当前仅在实际staging仍含该候选时执行严格丢弃,清空已接管的pending所有权,直接未知candidate丢弃仍拒绝;SDK保留原事务异常并在无原异常时传播清理异常,协调器去掉可选旧接口fallback并使falsy异常也不被遗漏。最终未经异常屏蔽的真实Native SDK/第二个IndexedDB writer检查11/11通过:传入task无澄清而持久task版本4有关键澄清,typed denial穿过finally,头与零solid保持、task不被清除、该候选不再staged,可信选择后r15/H30真实提交体积21205.750411731104的一solid。只在忽略的probe中安排真实写入时序,没有替换存储事务或伪造discard receipt;未据此声称所有取消、quota、import或WASM句柄泄漏都已验收。
最终整合rebase到 deacd92d(保留远端FEA/CAM、数值诊断和worker所有权修改)后,依赖构建、web构建、全workspace typecheck、15个受影响源码的ESLint及diff检查通过;同一当前源码的预算11/11、澄清/实际undo-redo10/10、上述晚到澄清11/11及产品读取8/8再次通过。原生检查使用确定性source或直接Native输入,不计AI自主完成率。预备Vite harness曾遇到SPA fallback、React import preamble、热重载中断和document/worker隔离头不一致,失败原记录保留,修正的是可丢弃运行环境;它们不是模型样本或产品几何成功。付费数字仍属于之前各自冻结的源码epoch,最终诊断/清理修复及远端整合后没有再次调用模型,因此不能把8/10直接称为整个最新整合版本的AI验收。静态图更新只是导航;设备/长会话/峰值内存、崩溃恢复、独立来源泛化和经验最优组合仍未证明。
16.10 已提交头、剩余额度与 thinking 预算的针对性核验(2026-10-01)
Section titled “16.10 已提交头、剩余额度与 thinking 预算的针对性核验(2026-10-01)”本轮源码基线为 9bacb13b,产品修复固定于 86b78307a70637127d59174610e90e462a96e95c。原生提交后刷新得到的 head summary 现在用于 stateAfter,不再报告施工前的头;StepLog 与压缩后的 capsule lastResult 保留实际剩余步骤和修复额度。plan、read、batch 的诊断各计一次,两次诊断允许继续修复,第三次停止;续行携带的修复次数不重置。能力定义、几何判据、AMIR/schema/catalog 与历史数据语义未变。
相同实际 Native 输入复现旧头和缺失额度,再验证修复后的连续提交、两次诊断后成功、第三次停止、未完成的步骤耗尽、续行计数与真实 round compaction,共 13/13 通过。使用实际生产 loop、原生 SDK、几何和 IndexedDB,决策 source 与用量是确定性输入;不是 AI 自主完成率。原 compaction 检查读错 trace 字段的失败记录保留,更正到真实 .step.compacted 后验收,不修改产品以迎合检查。workspace typecheck、受影响源码 ESLint、web 构建和 diff 检查通过。此前撤销/重做、权限与晚到澄清的验收范围仍见 §16.9,本次不宣称它们或崩溃恢复全部重新核验。
第一批:固定 high thinking 的四条有限链。 协议 1.3.1 SHA-256 e69dac3bf88eae0da07ef18e718568e9a6107c9a5b4f1fd743e2e4564d1600dd,顺序 HELD-01 B、C、CAL-02 C、B,各执行一次。需求、候选与几何 oracle 沿用既有输入;12 次实际生成、两次修复跨澄清/续建/编辑共享,每请求 4096 输出 tokens、60 秒,每链 $0.50,本批 $2。两臂共享受控零 provider 语义读取,C 再执行一次受控 Jev 判断;不测自主调用位置。
| 固定源码/协议的完整链 | 实际调用 | 保守费用 | 结果与直接证据 |
|---|---|---|---|
| HELD-01 B | 5 DeepSeek | $0.072167100 | fail;可信澄清前保持零几何。一次输出全为 reasoning(4096/4096,正文为零),之后虚构 assertionId、把最大安装空间当精确 bounds;第三次诊断停止,未提交几何。 |
| HELD-01 C | 10 DeepSeek + 1 Jev | $0.099210756 | fail;两次 malformed clarification JSON 消耗修复额度,随后正确澄清、初始建模及 done。编辑回复截断(reasoning 3579、正文 517、合计4096)成为第三次诊断,未提交编辑。 |
| CAL-02 C | 12 DeepSeek + 1 Jev | $0.159297222 | pass;R8、H35→45,同一程序/源码/参数身份、初始及编辑 done、几何和正常进程恢复通过。 |
| CAL-02 B | 3 DeepSeek | $0.023569500 | fail;已明确尺寸仍试图澄清,三次回复含额外大括号而被拒绝;不是 token 截断,无几何提交。 |
本批完整链 1 pass / 3 fail / 0 unknown,30 次 DeepSeek、2 次 Jev,费用 $0.354244578。三个实际 STEP(HELD-01 C 初始、CAL-02 C 初始/编辑)经 OCP 7.8.1.1 回读,均通过既有七项几何判据;正确初始工件不升级为完整 pass。相较旧批次 CAL-02 B 通过,本次存在观察到的回退,不能隐藏或推出统计性的源码因果退化。DeepSeek 实际模型和 fingerprint 均与 §16.9 相同;Jev 仍在矛盾需求强选 cand_C,建议没有变成用户许可。
单因素推导与第二批。 官方 thinking 说明与completion 契约确认配置的 max_tokens 包括 reasoning,medium 映射 high。因此 R+J≤4096 下,R 占满会使工具 JSON 无空间;这只能解释已观察到的分配/截断,不能解释所有语法或几何失败。拒绝同时改 effort 和增大 token 上限,也拒绝承诺保留固定正文空间就保证任务完成。调用前在 #355 预声明仅对原失败 HELD-01 B/C 各追加一次,使用已有 AIRA_MODEL_REASONING_EFFORT=none,源码、任务、提示、4096 上限、12 次生成、两次修复与每链 $0.50 不变;新增批次上限 $1,执行两次后结束。
接受协议 1.3.2 SHA-256 cbe5cb1cd626b1115aa8c70317d2169656c34d2d5ba458cd3391b73d157acfe3。准备 worker 在两个 provider-off 检查之后只改了协议时间戳,报告了另一个 SHA;协调器拒绝该记录不匹配,选用与实际两个运行记录完全匹配的原不可变快照,后改快照与更正均保留。没有重跑或付费补救。两条真实链均使用 thinking.type=disabled,所有 19 个生成响应 reasoning tokens 为零,实际模型/fingerprint 与 high 批次相同。
| thinking-none 的完整链 | 实际调用 | 保守费用 | 结果与直接证据 |
|---|---|---|---|
| HELD-01 B | 7 DeepSeek | $0.076467900 | fail;两次构造诊断后提交正确36×36×90初始几何,随后 export-step 多传 bodyId 被严格拒绝,成为第三次诊断。初始 partial STEP 正确;无完成的初始 done/后续编辑。 |
| HELD-01 C | 12 DeepSeek + 1 Jev | $0.143820810 | pass;一次构造诊断和一次编辑字段拒绝后恢复;可信澄清、36×36×90→H110、同一程序/源码/参数身份、两次 done、正常进程重开通过。 |
本批 1 pass / 1 fail / 0 unknown,19 次 DeepSeek、1 次 Jev,费用 $0.220288710;与第一批分开报告。两个 C STEP 和 B 的初始 partial STEP 全部独立回读通过,初始/编辑体积为116640/142560,bounds、六个平面、单 solid/shell 和有效 BRep 均满足既有判据。C 的正确链用完12次生成,不代表已获得长链吞吐保证;B 的部分恢复和 C 的完整恢复都只是正常浏览器进程关闭重启,不是崩溃/断电。Jev 又强选 cand_A(confidence0.29),生成器仍自行澄清并接受可信用户选择;不能把 C 通过归功于正确 Jev 建议。
这两条 targeted repair 输入没有独立留出或重复随机化:关闭 thinking 在此消除了显式 reasoning 的正文竞争,C 完整结束,B 仍失败;不能推出一般成功率、费用优势、最优组合或直接切换部署默认值。C 的完整通过比 high 的失败花费更多,失败较便宜不等于更高效率。剩余诊断应针对真实能力和公开契约:require-bounds 实际比较精确边界,不等于“位于最大安装空间内”;B 两次构造均把数组传给要求标量 width/height 的 drawRectangle,泛化 deleted-handle 消息不足以证明具体生命周期根因。不得据此放宽几何、静默修 JSON,或只追加提示掩盖能力/诊断缺口。
两个批次总新增 $0.574533288;累计保留 $5.548489794,累计 DeepSeek332次/Jev48次,剩余累计授权 $20.328403232,所有52个新增结算用量已知,无活跃租约。旧费用、失败和 unknown 不重置;峰时未命中费用是保守估计,未核对供应商账单。不可变协议、实际回复/用量、Native trace、STEP 和更正存于既有忽略路径,开发验收与后续范围仍由 #355/#365/#366/#356 管理;不合并源码/协议批次为一条“公平成功率”。
16.11 有条件可行的责任结构与契约修复(2026-10-01)
Section titled “16.11 有条件可行的责任结构与契约修复(2026-10-01)”在 754fe49a 完成 rebase 后,采用的方案是同一原生权威下的确定性计算与验收 + 开放生成 + 有条件的语义咨询。技术责任可以确定,任意需求上的最佳模型比例和预算内自主成功率仍不能由有限探索确定。供应商、权重、任务分布和信息核未知时,§16.2 的 Bellman 式是条件性推导,不是已实现的全局 CAD 路由器;缺少估计的观察/转移核 K 和损失,不能声明经验最优。开放意图集合也不是一个已知有限枚举。
| 责任 | 可执行选择 | 保证与停止边界 |
|---|---|---|
| 数值、单位、引用、权限、几何求值、约束检查与持久提交 | 既有 Native SDK、编译器、几何内核与事务路径 | 模型不能代替它们;只有相同当前绑定上的已声明检查可以提供验收依据。无证据保持 unknown。 |
| 未出现的解释与开放构造、修复提议 | 当前生成器 deepseek-flash;精确能力由 lookup 提供 |
生成输出只是提议;可以失败、耗尽预算或提出未决问题,不保证任意任务能找到方案。 |
| 已有候选的有界语义缺口 | 可选 jev-1.13.0 咨询,比较其费用与已必要生成轮的边际判断成本 |
不强制每步调用;算术/几何事实先由代码处理,未校准 confidence 不作工程正确率或用户授权。 |
| 机器观察不能区别的偏好或关键矛盾 | 当前持久澄清与可信用户选择 | 等待是有效暂停结果,不能算完整 CAD 成功;不得伪造用户选择。 |
程序结构沿用 runStepTask、任务/frontier、ledger/胶囊、共享 SDK 与执行器。问题调度依赖“义务、当前可见事实、候选覆盖、使用点、剩余资源”,不能另建四个相互提交的 Agent。当前已实现的是有界发现、调用、反馈、提议检查和提交;通用的增量收益估计、统计自动路由或全部数值事实的自动提取未由本轮实现,不应把上表的责任裁决宣称为这些调度机制已经完成。
对于单次调用的最大账面费用 r、已保留费用 c 和授权上限 B,准入条件为 c+r≤B,先持久预留,已知 usage 后结算;未知 usage 保留 r。因此在费率和供应商输入/输出上限成立时,每次准入保持费用不变量。这依赖既有网关准入与本次实验账本,不是浏览器仅在调用后检查消费就能提供的现金承诺。按已核对的峰值价,DeepSeek 在 4096-output 配置下 2^20×300+4096×1200=319488000 nanoUSD 小于预留 320000000;最终 16384-output 配置下 2^20×300+16384×1200=334233600 小于预留 340000000;Jev 65536×42=2752512 小于预留 3000000。这些是保守边界,非账单;正常供应商缓存或错峰可能更便宜。DeepSeek 价格和 Jev 模型/限额于本轮核对。
若单轮操作返回或由真正可执行的取消/隔离机制结束,有限 source-turn 循环的宏观秩 maxTurns−usedTurns 随已完成轮次递减;这只证明有限轮数,不能证明同步 WASM 必定被 AbortSignal 中断或 CAD 构造必定完成。事件循环计时器本身不构成对任意同步 native 调用的硬实时保证。当前浏览器预算默认值与本次 12 轮/2 修复实验配置须分开。胶囊的实际字节限额限制单次工作集;4 bytes/token 是经验预算换算,不能证明任何输入的 tokenizer 上界。
超长设计链按持久需求与依赖组织,完整依赖允许只重算变化闭包;不完整依赖保持整任务/修订失效。全局约束可能使闭包等于全图。旧事实可复用不等于旧提交证据可复用,缓存丢失返回封存重放。同一状态、无答案依赖的问题可以合批;共同写入仍串行结算。有限工作集、有限每段预算和恢复点不能证明任意总链长度的内存、终止或语义成功率。需要独立的整链验收,不以脚本数、工具数或字节下降替代。
本轮产品修复为 42aa82b7:从全量权威 step 变体机械派生每种的顶层字段、类型、必填和附加字段规则;嵌套约束仍由 Native lookup 提供并由原生验证器执行。投影删除嵌套约束,所以原生合法输入属于投影语言;投影通过不证明原生合法或几何正确。export-step 不再被广告为接受 bodyId。当丰富 SDK 选择使形状投影超过共享 80000-byte 限制时,退为全部 kind 的索引并要求 lookup,不丢弃 kind 或 SDK 工具;已有超限选择仍由网关拒绝。
同一当前 SDK 下,对比 HEAD 的旧 grammar 与新实现,遍历全部 2^11−1=2047 个非空 SDK 选择:原先 1887 个合法尺寸组合全部保持可接受,909 个触发轻量 fallback,当前 154 个仍超限且原先已超限。默认 schema 从 56562 增至 67513 bytes,保留全部 42 kinds;完整原生 plan schema 是 215976 bytes。这是清楚字段责任的取舍,不能声明 token 或费用降低;全部 11 SDK 同时展开仍是未解决的传输域限制。矩形入口在分配前拒绝非有限/非数值尺寸和无效半径类型,保留原 alias、builder 与有限数值的下游语义;未改圆、椭圆等入口。尺寸描述明确 require-bounds/size 是容差内的坐标/尺寸相等,而非安装空间包含;export-step 导出当前求值产品根,只取 kind。
当前实际行为证据包括 13 项提交头/反馈/修复边界/压缩检查,两个原始数组参数程序的 Native 拒绝且 head/task 不变,合法 36×36×90 的实测体积 116640 与 1 solid/6 faces/12 edges/6 wires,以及 5 个精确尺寸、包络拒绝、合法/非法导出及参数 numeric-range 事务。后者检查的是参数数值关系,不能证明任意 authored 测量算法与空间包含等价。全局 typecheck、受影响源码 ESLint/format、依赖构建与当前 web 构建通过;最初旧 dist 缺少远端新 FEA 导出及本轮 TypeScript 提示的失败经实际依赖重建和源码修复消除。无新增 test/spec 或独立执行器。
冻结源上的有限闭环资格。 在上述产品修复后,先冻结源码 42aa82b7、真实 Native/网关构建物、任务、可信选择控制、判据和账本,再执行预先声明的有限批次。所有输入都是此前已用于发现问题的 HELD-01,因此仅是 repair-only 探索,不能称独立留出。B 是生成器与确定性核心,C 额外读取一次 Jev 咨询;两者均通过真实持久澄清接受同一可信控制选择,而非允许模型代用户授权。供给商 alias 的实际响应身份与 wire reasoning 配置已保留;alias 不是冻结模型权重。
| 预声明配置 | 调用与保守费用 | 整链结果及定位 |
|---|---|---|
| none / 4096 / $0.50,B 一次 | 4 DeepSeek;$0.047356200 | fail:未先澄清关键冲突;不存在的 assertion ID 与退化 profile 消耗修复,无完成几何/STEP。 |
| none / 4096 / $0.50,C 一次 | 10 DeepSeek + 1 Jev;$0.124708164 | fail:澄清正确;profile 字段错误、矩形数组参数和 Drawing.extrude 先后拒绝。新标量诊断确实生效。Jev 选择 cand_C、confidence0.47,未代替用户决定,也没有得到正确推荐的证据。 |
| high / 16384 / $0.50,B 一次 | 9 DeepSeek;$0.170382300 | fail:澄清与初始 36×36×90 几何/导出正确,但累计170382300加下一请求预留340000000超过500000000,编辑阶段停止。费用准入符合不变量,不能把预留夹到余额以宣称成功。 |
| high / 16384 / $0.75,B 最终一次 | 10 DeepSeek;$0.125029500 | pass:澄清、初始构造、同一程序/源码/参数身份的 H90→H110 修改、两次几何验收/STEP、warm reopen 和正常浏览器进程重开全部完成。 |
本轮合计 1 pass / 3 fail / 0 unknown,33 DeepSeek + 1 Jev,保留费用 $0.467476164;累计 $6.015965958,DeepSeek365/Jev49,累计剩余授权 $19.860927068,无未结算租约,所有本轮 usage 已知。最后一条仅增加财务配置至 $0.75,实际只花 $0.125029500;它是新的可行配置见证,不是同总预算的收益比较,也不能把前面三条删出失败记录或证明增加预算因果地提高成功率。供应商账单未核对,缓存、错峰价可低于峰值保守估计。
最终协议1.3.5 SHA-256为 02701592115f6b451b82b1dc19925273c1b046737f6557e2d569cbc134d46fe1;前两条属于1.3.3 56937cf72eab11dd8d976d1f24bc68f37c7e84101b19db2de12131b534d9441d,第三条属于1.3.4 a7b083529e6924d4faf1be90958a65727480554aa19913092abfb79f4be773fe。1.3.3未使用的展示字段 worstCaseTotalGeneratorAttempts=337 是记录错误;实际准入与 sessionAttemptLimits=356 正确,更正单独保留,不改写已执行的不可变协议。
两个最终 STEP 由锁定 cadquery-ocp-novtk 7.8.1.1 独立进程回读,各七项判据全部通过:有效 BRep、一个 solid/shell、体积116640→142560、bounds [-18,-18,0]..[18,18,90/110]、六面和平面位置。初始/编辑 STEP SHA-256分别为 b65a2cfaac4da0d36bce600fad24d7098dc46901d30e62738b26f324515df412 / 4bc75717c2171b0228936a8eb8839e67082b4fbcea59a3c12e9fd9e843874f67。原生与 OCP 共用 OCCT,仍可能有共同算法缺陷;判据限定于声明的轴对齐柱体域。恢复是正常进程关闭重开,未验证崩溃/断电;脚本提供的可信用户答复不证明真实人机澄清体验或任意自然语言覆盖。
可执行裁决。 采用前述责任结构,保留单一 Native 执行与持久任务。当前可用的探索配置是生成器 deepseek-flash、显式 high thinking、单请求16384 output上限、每链12次生成/2次CAD修复、供应商响应60s实验超时、$0.75财务配额与每请求$0.34保守预留;用量未知保留预留,完成前查当前义务。这个配置获得一个完整 Native 见证,没有在本轮自动改为部署默认值。Jev 集成保留为有条件语义咨询,尚未获得强制每链调用的质量/费用资格。更广域的效益、模型比例、confidence阈值、自动 phase effort 切换和超长链吞吐保持未验证;统计自动路由不作为当前可行闭环的前置依赖。下一次经验比较应冻结所选配置后使用独立需求组、同正确性与可比总预算,并把失败归因到需求/规划/协议/几何/检查/基础设施,而非无目的增加实例。
付费冻结源之后的诊断修复。 failure-diagnosis.ts 复用既有 prototype descriptor 查询,区分精确 r/p 命名空间与局部 receiver。局部 .extrude 失败只报告存在该方法的导出 prototypes,并明确 receiver 的运行时类型不可得;不据变量名推断 Drawing/Sketch,不遍历和缓存全部方法来推荐任意近似调用。Shape getter 建议改为条件式,参数命名空间只认自有数字参数,避免把 p.faces 当作 Shape 属性或把非函数库值说成函数。无新增模型权威、执行器、类目录或通用数值算法。
最终 kernel/web 重建后,通过真实 Native 再现 C 的原始 sketch.extrude 输入:错误准确指向局部 receiver,head/task 保持不变;合法 Drawing.sketchOnPlane('XY').extrude(90) 在 Native 完成提交,bounds为 [-18,-18,0]..[18,18,90]。同构合法路径的直接内核测量为体积116640、1 solid/6 faces/12 edges/6 wires;七个 helper 诊断回归与协调器额外四个命名空间/属性检查只支持其局部消息语义,不算 Native 事务或 AI 自主成功。最终受影响源码 lint/format、kernel/web 构建及 AST-only graph 更新通过;未增加 test/spec。此修复晚于四个付费样本的冻结源,不把最后一次模型通过归功于它,也未为其再追加付费调用。
16.12 任务特性实测、数学推导与执行结构裁决(2026-10-01)
Section titled “16.12 任务特性实测、数学推导与执行结构裁决(2026-10-01)”官方模型特性与预声明基线。 于 2026-10-01 核对 Jev 1.13 特性与限制、Jev 型别、费用与上下文、confidence 定义和 DeepSeek 模型与价格。Jev 请求固定版本 ID;DeepSeek alias 与在线文档会变化,不能称冻结供应商权重。
- Jev(
jev-1.13.0):面向短小的语义与常识判断,输出选择(Choice)、评分(Score)或标量概率(Noul)。官方明确报告算术、数值精度、多层间接推理和大量无关上下文的弱点,建议算术留在代码、开放生成交给生成模型。输入 $0.042/M tokens(42 nanoUSD/token),输出免费;请求总量 64k tokens,state 加最长问题 32k tokens。Aira 的 65536 文本长度限额是另一个应用限制。本轮只测 Choice;未测 Score/Noul 的准确性或校准。 - DeepSeek(响应 model=
deepseek-flash,system fingerprint=aeb56401ca74e127821c4f9126dcb669):生成文本、计划与程序,支持工具调用及非思考/思考配置。官方当前标为 V4.1 Flash,响应仍只暴露 alias,未暴露不可变权重。峰时/错峰每 token 费用分别为:输入未命中 300/150 nanoUSD,缓存命中 6/3,输出 1200/600。开放输出能力可以确定其职责资格;本轮判断题不测开放规划或任意 CAD 生成准确性。
本次特征探索冻结源码 177ee45daa36ce446e49f5e6563a3af963a974e8。调用前以 #355 预声明固定方案;完整协议与输入和 78 次观测保存无法从产品源码重新生成的合成题目。协议 SHA-256 379e6aa2b11920f62b438fbb5f8c46abe42f460092e2a81bd78bd12b72221864,脚本 33af006b0f3a195f60e5f4a5efcef3a675e2d542b55488f3995bb0acf21fa6d9,原始证据 f6673041436012d533ca9a3ce18540751cb87287988126fb95882336cde44aaa。同语义信息、候选、判据;DeepSeek 使用小型 canonical done.summary 合同,未携带完整 CAD schema。seed=20261001,16 exploration/16 evaluation,中英文各16;主 DeepSeek none/4096,四个预声明 high/16384 对照,45s、零重试;每个配置/题目一次观测。所有78计划槽预先记 unknown,最终全部调用并结算,41 DeepSeek/37 Jev,usage均已知,无活跃租约。候选顺序破坏了正确项总在首位的偏置,但未验证配对排列敏感度。evaluation标签仅表示未据这些输出调参,不证明代表性任务分布、真实 CAD 语义覆盖或自主成功率。计时覆盖准入至解析/结算,中位数/p90采用 nearest-rank;请求体仅留哈希与字节长度,设置由调用参数及冻结适配器代码派生,回复保留答案、usage与可见身份。所有主配对 state hash相同。
本批费用硬上限为 $1,沿用既有授权;每请求调用前持久预留,已知 usage 后按保守峰时未命中价结算。最终保留费用估计 $0.015494634;缓存感知峰时估计 $0.013951722;套用官方十月一日节假日错峰费率估计 $0.007716678。供应商账单未核对。累计保守保留费用 $6.031460592,授权余额 $19.845432434,累计尝试 DeepSeek406/Jev86;此前费用与失败记录全部保留。
同状态实测对比数据。 在 32 组相同状态输入配对下(所有配对 state hash 完全相同),两模型实测表现如下:
- 纯语义 24 组(FAM-1/2/3):两模型均 24/24 pass(100%)。Jev 耗时中位数 308 ms,p90 410 ms;DeepSeek 耗时中位数 686 ms,p90 924 ms。费用方面,Jev 24 组费用为 $0.000814884,DeepSeek 缓存感知峰值费用为 $0.006571332(比值约 8.064x);若计入 DeepSeek 官方错峰半价($0.003285666),比值约为 4.032x。
- 全主样本 32 组:
- DeepSeek:31 pass / 1 fail / 0 unknown。正确弃权(correct abstention)8 次,错误采纳(incorrect acceptance)1 次,无多余弃权。单次耗时中位数 686 ms,p90 921 ms,耗时总和 22661 ms。保守保留预算 9779700 nanoUSD($0.009779700),已知缓存感知峰值费用 8575476 nanoUSD($0.008575476),输入 24211 tokens,输出 2097 tokens。
- Jev:29 pass / 3 fail / 0 unknown。正确弃权 8 次,错误采纳 3 次,无多余弃权。单次耗时中位数 310 ms,p90 410 ms,耗时总和 11730 ms。费用为 1075410 nanoUSD($0.001075410),输入 25605 tokens,输出 1593 tokens。
分用例族(family)观察:
- FAM-1(显式未来编辑意图与规则):8/8 均通过。DeepSeek 耗时中位数 612 ms,Jev 301 ms。
- FAM-2(相关证据与边界状态):8/8 均通过。DeepSeek 耗时中位数 716 ms,Jev 307 ms。
- FAM-3(缺失/冲突/歧义候选与弃权):8/8 均通过(均正确返回
__abstain/status: 'abstained')。两模型均未发生多余采纳或漏判。DeepSeek 耗时中位数 711 ms,Jev 308 ms。 - FAM-4(算术与几何关系判定):DeepSeek 7/8 通过(1 fail),Jev 5/8 通过(3 fail)。根协调器复核的 8 项派生数值如下:
- CASE-25: 壁厚 5 < 6(Jev 错选,confidence 0.72)
- CASE-26: 边距 8 < 10(两模型均通过)
- CASE-27: 过盈量 0.027 处于 [0.015, 0.035] 容差带(两模型均通过)
- CASE-28: 弦长间距 34.426406871 > 30(DeepSeek thinking none 失败;Jev 错选,confidence 0.35)
- CASE-29: 质量 220.1472 > 200(Jev 错选,confidence 0.40;DeepSeek 通过)
- CASE-30: 截面惯性矩 $I_x = 106666.6667$ vs $26666.6667$(两模型均通过)
- CASE-31: 销轴最小直径 10.92548 选定标准值 12(两模型均通过)
- CASE-32: 柱长细比 103.923 > 100(声明规则通过;注:此为声明规则,非普遍工程定律)
失败定位与显式对照组。
DeepSeek 在无思考配置(thinking none)下仅失败于 CASE-28。在预先声明的 4 项显式 high thinking 对照组(highControls:CASE-18、CASE-24、CASE-28、CASE-29)中,CASE-28 耗时 1619 ms 成功选出 cand_spacing_adequate,4 项全部通过。这证明该 high 配置在此题答对;单次对照不证明提高 effort 必然改善准确率,也不测开放生成。
Jev 失败于 FAM-4 的三项算术关系(CASE-25 confidence 0.72、CASE-28 confidence 0.35、CASE-29 confidence 0.40)。单例中 CASE-25 在自报置信度 0.72 下仍给出错误选择,直接反驳了“任何采纳规则只要设定门槛 $\tau \le 0.72$ 并采纳置信度 $\kappa \ge \tau$ 的预测即可免验放行”的假设(因为当 $\tau \le 0.72$ 时,该规则会错误地采纳本次观察到的错误预测);这证实了自报置信度不能单独替代工程校验,但单例不能推导出经验校准分布或后验失误率。
同状态合批实测(Same-State Serial vs. Batch)。 在相同状态切片(两提供商各有 5 个快照,共 10 个快照哈希一致为 34cc6dc3991e0bceb339bd8b0ddea62b15047214b0099d9cd1b986c54e86144c)下对 4 个语义问题执行串行与原生合批对照:
- 两模型在串行与合批下均 100% 正确回答 4 题(含 Q4 正确弃权)。
- Jev:串行 4 次总耗时 1849 ms(中位数 324 ms),保留费用 $0.000298494;合批 1 次总耗时 260 ms,保留费用 $0.000107730。本次合批观察的延迟低 85.9%,费用下降 63.9%。
- DeepSeek:串行 4 次总耗时 2282 ms(中位数 586 ms),缓存感知峰值费用 $0.001791072(保守保留 $0.001941600);合批 1 次总耗时 929 ms,缓存感知峰值费用 $0.000490668(保守保留 $0.000528300)。本次合批观察的延迟低 59.3%,缓存感知费用下降 72.6%。
- 结论:两种调用的答案在这一组相同;本次合批观察费用与延迟更低。串行在前、合批在后,未重复随机化时序,因此不能外推因果或普遍收益。语义可合批性取决于共享状态、问题无答案依赖与相同判据;实际费用/耗时还依赖序列化、缓存和服务负载。
推导数学与决策边界。 在声明的适用域、损失与资源模型下,可推导分配规则:
- 确定性事实与强制校验:本批壁厚、边距、质量等是已声明公式及输入下的可计算谓词,模型猜测没有新增信息。由代码处理它们,核对单位、数值域、容差与稳定性。一般几何/非线性问题不能假设费用或错误率为零:模型可以提出表示与求解策略,结果仍由适用内核/检查器核验,证据不足为 unknown。若两动作的适用合同相同、确定性动作的错误损失、费用和延迟均不高于推断动作,则它在上述加权目标中弱支配推断动作;本批固定公式支持此责任划分,不推广到所有求解问题。强制数值/几何验收不因费用高而移交模型。OCCT 使用容差;Aira 将缺少检查证据记录为 unknown。
failure-diagnosis.ts提供解释,不是几何验收器。 - 生成能力与递归组合:Jev 的单次原生响应受限于离散选择、评分与标量概率($\mathcal{Y}_{\mathcal{J}} = \text{Choice}(K) \cup \text{Score}(M) \cup [0,1]$);递归组合(宿主决策树或递进合成)可构造复杂设计结构,无集合包含关系证明其在原理上必然不可为。然而,在现有架构实现中,生成新计划、复杂程序结构与解释说明的能力归属于开放生成器 $\mathcal{G}$。
- 可达目标与决策泛函:在未测定真实损失分布与信息转移核时,一般风险泛函不宣称已求得全局最优解,仅在可达动作空间 $\mathcal{M}{\text{attainable}}(\mathcal{Y})$(显式包含模型弃权与用户澄清 $\mathcal{U}$)上描述权衡: $$V(m) = \mathbb{E}[L{\text{err}}(m)] + w_{\text{cash}} C(m) + w_{\text{lat}} T(m)$$ 费用项 $C(m)$ 必须区分实测缓存命中/未命中与保守保留预留。
- 级联费用与候选误差分解:通用级联费用为:
$$C_{\text{casc}} = \mathbb{E}[C_J] + P(E = 1) \cdot \mathbb{E}[C_L \mid E = 1]$$
盈亏平衡条件 $q < 1 - C_J / C_L$(其中 $q = P(E=1)$ 为升级概率)仅为假设固定确定性单次费用($C_J, C_L$ 为常数)下的条件性结构简化,而非经验校准数值;本设计不引入未测定的经验 $q$ 值。级联失误率为:
$$P(\text{err}{\text{casc}}) = (1-q) \epsilon{J \mid \text{acc}} + q \epsilon_{L \mid \text{esc}}$$
其中 $\epsilon_{J \mid \text{acc}} = P(\mathcal{J} \text{ wrong} \mid E=0)$。在协议支持弃权时,缺失真实目标($y^* \notin \mathcal{C}$)返回
abstained或no-fit属于正确弃权,不能计入采纳损失(acceptance loss)。强制目标选择(compulsory selection)才导致 $P(\text{err} \mid y^* \notin \mathcal{C}) \equiv 1$。 - 长链联合界与验证拦截:Boole 联合界使用无条件误差事件 $P(\bigcup_{i=1}^N E_i) \le \sum_{i=1}^N P(E_i)$ 或一致条件上界 $\sup_h P(E_i \mid H_{i-1}=h) \le \bar{\epsilon}i \implies P(\bigcup{i=1}^N E_i) \le \sum_{i=1}^N \bar{\epsilon}i$;条件于有效前缀的链式成功概率乘积 $P(\text{all succeed}) = \prod{i=1}^N q_i$(其中 $q_i = P(\neg E_i \mid \bigcap_{j=1}^{i-1} \neg E_j)$)属于概率链式法则精确恒等式,无需独立性假设。验证拦截残留风险严格依赖条件检出敏感度 $P(\text{detected} \mid \text{error})$,即 $P(E_i \land \neg D_i) = P(E_i)(1 - P(D_i \mid E_i))$,此项为条件性结构界限,不预设未测定的检出率数值。
- 快照投影边界:根据
packages/aira-contracts/src/semantic-assessment.ts中的projectAuthorizedSemanticSnapshot,快照受可见范围(task-intent、workbench.task.read-only、public-metadata)与文本长度上限(MAX_SEMANTIC_SNAPSHOT_TEXT_LENGTH = 65536字符)严格限制,此为 Aira 端文本投影上限而非模型 API 限制(提供商限制为 64k tokens/request 及 32k tokens/state+longest question);快照并不投影完整 B-Rep 几何或拓扑;canonicalTaskIntentText仅是 intent 范围的标准化文本,当前 Native 读取可获取限定事实,但覆盖范围是有界的。
具体执行结构与责任映射。
结合上述特性实测与数学推导,确立的执行管线结构为: $$\text{确定性核心计算/约束} \longrightarrow \text{同状态有界语义分支(Jev 先行或必要生成轮内比较)} \longrightarrow \text{仅在需要开放输出时调用生成器 } \mathcal{G} \longrightarrow \text{同一原生检查与 CAS 事务}$$
- Jev 先行能力:Jev 具备在无 LLM 生成候选的情况下先行分类/评估离散领域参数(材料、基准面、语义意图规则)的能力。
- CAD 模型权威:CAD 模型的权威严格归属于共享 Native / 内核 / 事务路径;
runStepTask承担有限步轮循环协调器职责,TaskLedger仅维护一次性协调上下文,均非竞争的 live 模型权威。 - 当前代码已实现的能力:有界能力发现(
libraryReferenceTool)、只读快照评估(semanticAssessmentTool)、任务账本跟踪(TaskLedger)与失败诊断解释工具(failure-diagnosis.ts,诊断用途而非 OCCT 门禁)。 - 明确未实现的能力:统计自主路由器、全局模型比例策略、全量数值事实自动提取机制均未部署。
- 本裁决保留 §16.11 已确立的所有原生见证、OCP 7.8.1.1 回读证据与费用不变量。
16.13 按官方 cookbook 应用到 Aira(2026-10-01)
Section titled “16.13 按官方 cookbook 应用到 Aira(2026-10-01)”官方已有模型边界说明,后续问题是怎样把判断放到产品信息流中。依据 state、fan-out、function calling、预解析值提取和组合评分,代码提供相关命名状态与候选,一次请求完成共享状态的独立判断,再由代码消费适用分支。问题答案决定新状态/候选时另起一轮;硬约束不能被加权评分抵消。候选覆盖来自解析、原生发现或必要生成,Jev 选择角色,代码复制精确值、转换单位与检查合法性。没有候选或证据不足保留 unknown/弃权,不强迫选一个。
相关状态契约。 aira_semantic_assessment.read 支持可选 focus: {requirementIds, hypothesisIds},两数组均显式给出、各最多 32 个不重复原生 ID、总数至少一个。省略 focus 使用完整投影。权威投影自动加入所选假设引用的 retained requirements;引用不存在或范围未授权则拒绝。返回快照携带排序后的原始 selector,状态列出实际包含项、省略数量和 unavailable 声明,仍保留最新用户输入、目标和已解决澄清。evaluate/diagnose 使用同一投影;调用者不能写入状态文本。SDK 定义、服务端校验与宿主转发共享当前语义。
正确性边界。 若局部问题的必要信息已包含在投影中,裁剪才保持该问题的依据;自动引用闭包不证明所有隐含语义依赖已覆盖,也不证明全任务可行。完整核心约束和提交检查继续独立执行。焦点状态含完整任务意图的摘要,其身份仍绑定被省略内容;focused 评估要求精确 taskVersion,并在调用前后权威重投影。结果仍是局部建议,不是全部需求满足证明。状态字符长度缩小不等于 tokenizer 预算保证或实测费用改善。
数据范围。 扩展现行 0.2.0 只读 assessment 的可选快照字段和当前 SDK 输入;内部 currentness 函数改为异步,使用既有 WebCrypto 校验完整意图摘要,所有调用点等待其结果。不改变 AMIR、已提交 Revision、history 或设计任务存储语义;使用 focus 的客户端和宿主需要相同当前构建。不引入旧契约兼容入口、第二个投影器或自动模型比例路由。原始请求、费用和 Native 验收状态由对应 issue 记录;源码组件检查不替代实际 Interface 或供应商调用。
16.14 相关状态与批量判断的 Native 实测及调用位置边界(2026-10-01)
Section titled “16.14 相关状态与批量判断的 Native 实测及调用位置边界(2026-10-01)”在 49f160e1 基础上修复公开 Native 会话遗漏可信 semantic scopes/evaluator 的接线,并通过正式「AI 访问」授权进行实验。任务意图由产品输入框持久化;14 个原生候选含固定孔距、固定边距及 12 个独立标签候选。仅选择前两项的状态由 9,378 字符缩至 2,023 字符,未知 selector 被拒绝。每次评估前后实际模型、任务和 Revision 相同;实际新增候选后,旧快照在供应商调用前被判 stale。该空模型任务没有 retained requirement,因而这一组不验证该引用保留行为。
固定 Jev 1.13.0 的 7 个预声明调用共获得 15 个局部类型化判断,全部符合声明意图:Choice 选固定孔距,Noul 为 0.98,Score 为 1.99–2(声明尺度 0–2)。两次完整状态批量调用各用 4,777 input tokens,两次相关状态批量调用各用 1,704;后者减少 64.3%。三个相关状态单问调用合计 4,592 input tokens;相同三个问题的批量调用减少 62.9%。总输入 17,554,按官方每百万输入 $0.042、输出免费计为 $0.000737268,7 个实际调用已结算,无未结 reservation。首次完整状态调用供应商耗时 1,505 ms,其后完整状态 281 ms、相关状态 269/273 ms;固定顺序和首次启动效应不支持独立的延迟优势结论。这是一个英文局部任务中的开发对照,没有留出样本,不能推广成自主设计成功率或全流程节省比例。
另外通过 Chrome 的公开 MCP 与原生发现,执行双孔板创建、长度 80→100 mm 编辑、故意违反孔距约束的请求,以及显式 restore-revision 撤销/重做。原生实体与双孔声明检查通过;编辑体积从 11,717.256661176918 增至 14,717.256661176918 mm³,与独立解析表达式一致,孔距保持 40 mm。改孔距为 50 mm 的请求返回 EXACT_GRAPH_ASSERTION_FAILED,已提交模型和 Revision 不变;恢复后长度分别为 80/100 mm,断言仍有效。这是确定性原生执行与恢复证据,不能算 LLM 自主规划或完整协作策略通过。嵌入浏览器先前同类创建请求遇到断线;重新授权实际回读确认仍为空模型、任务保留。Chrome 同类请求通过,断线的底层原因仍未知,未抹去这次基础设施结果。
准确性优先的选型。 用户明确将准确性设为下一阶段硬门槛。采用 Jev 承担适合的语义判断、生成模型补齐开放输出、核心执行精确计算与验证的责任分工;判断域、候选覆盖、弃权与澄清阈值由项目准确性证据限定。速度与费用保留运行记录和授权预算控制,证明其优于其他调用组合不作为当前验收的前置条件。下述费用推导用于解释已记录的开销,不代替准确性验收,也不要求另开速度或费用优劣实验。
调用位置推导。 设基线为一次本来必须执行的生成调用加核心执行/恢复,协作为一次 Jev 判断加后续必要生成与核心执行/恢复。在同一正确性目标和可比总预算下,费用优势的条件是
[ \mathbb E[C_{G,base}+C_{core,base}+C_{repair,base}]
\mathbb E[C_J+C_{G,after}+C_{core,after}+C_{repair,after}+C_{projection}]. ]
串行延迟亦须由后续生成、执行或恢复的实际节省超过新增判断与投影耗时。生成输入/输出、缓存命中、失败与弃权、推测调用均进入相应项;不能预设只会节省输出 token,也不能预设增加一次判断一定加速或减速。成功概率按判断结果分支求和,允许下游发现并恢复错误;不能把建议型管线强写成两个正确率的乘积。若已有确定性执行分支能满足输出义务,Jev 才可能省去开放生成;没有候选或缺少具体实现时仍需生成。相关状态和共享批量只证明降低本组判断费用,尚不决定新增判断是否值得插入必要生成前。
实现边界。 当前同一 runStepTask 增加显式 opt-in advisory-frontier,最多 8 个当前未解决候选,完整意图与规则留在共享状态。Choice 仅给后续生成建议;none 保留开放生成,歧义阈值 0.5 仅为未标定的保守停止规则,尚未证明澄清后自动恢复的闭环。调用前要求有效模型价格,调用后实际 usage/timing 按 Jev 与生成模型分别归集;未回答、过期和费用未知的尝试保留,未知费用阻止后续模型调用,续跑携带语义用量与费用分项。公开响应 0.2.0 增加可选 usage/model/timing 元数据,不改变已提交几何或任务存储语义。默认仍使用既有策略;opt-in 协作循环的四场景成对实跑、运行中撤权/过期费用保留及完整模型组合收益不能由这些组件结果追认。