AI 能力发现、编辑与抽象
研究总览 · 2026-09-20
原生语义、发现与诊断机制,以及有限 AI 试用的证据边界。
10. 在既有研究上具体突破什么
Section titled “10. 在既有研究上具体突破什么”本次主线的突破目标是让 AI 用稳定、可发现的设计关系掌握并组合建模能力,由内核据此决定求解表示与几何构造。在保持声明设计域的前提下,等式消元、约束类归并、部分凝聚与已知截面直接构造减少实现这些关系的计算成本。下面的证书搬运、局部修复与抽象学习服务于这一主线,按成本门槛启用;它们不是所有请求必须承担的基础层。
10.1 语义约束证书搬运
Section titled “10.1 语义约束证书搬运”算法:提取证书非零支撑 → 规范化关系角色与单位 → 在新结构中寻找唯一的槽位映射 → 检查系数、变量域和外近似方向 → 搬运乘子并精确核验 → 成功才剪枝。
简单正确性命题:若 (A’=PAQ) 是行/列置换,(\lambda’=P\lambda),则 (\lambda’^\top A’=\lambda^\top AQ=0)。如果新右端仍满足 (\lambda’^\top b’<0),新约束子集不可行;附加其他约束不能恢复可行性。
研究贡献目标是将代数证明与 CAD 语义引用、结构重写、近似方向一起检查。数学正确性来自明确前提;净加速及可搬运比例需要测量。对偶缓存本身已有先例,不宣称学术首创。
10.2 带语义分隔符的局部结构修复
Section titled “10.2 带语义分隔符的局部结构修复”从被修改关系出发收集局部变量和对象,固定外部已验证分隔符;尝试局部参数与结构改变。分隔符、查询成员或跨区域关系变化就扩大范围。与只沿特征 DAG 重建的区别是,额外追踪检查器实际读集和量词范围。
可证明部分是 §7.2 的组合条件。经验目标是减少真正的几何重建与重新验证,同时保持引用和未修改要求。若多数任务都必须扩到全局,算法收益假设被推翻;不能把失败隐藏成局部成功。
10.3 具有执行契约的领域抽象
Section titled “10.3 具有执行契约的领域抽象”Stitch 负责寻找模式;Aira 将可展开结构、单位、引用效果、可检查前提、开放参数域绑定为同一原生能力。AI 通过现有发现机制查询和调用,且每次实际结果仍验证。
研究目标是让抽象提高跨任务搜索效率,同时避免新增几何原语和重复实现。语法压缩、安全展开、跨任务收益是三个独立结论,不互相替代。
10.4 可选优化的收益反例
Section titled “10.4 可选优化的收益反例”若证书匹配与核验比重新求解更贵、抽象库扩大选择空间而降低留出成功率,或语义分隔符极少保持,则对应优化在该需求分布上的收益假设被推翻。应禁用或限制该优化并修正性能结论,不能据此缩小设计表达域。多数任务无法归约或检查成本占主导,也会限制整体加速幅度;这不自动推翻持久语义与统一执行的正确性依据。
16. 面向 AI 认知成本的架构解与进化机制
Section titled “16. 面向 AI 认知成本的架构解与进化机制”16.1 选定机制:可求解的设计语言
Section titled “16.1 选定机制:可求解的设计语言”“持久设计关系 → 有界实现合成 → 实际验收 → 可验证的关系抽象积累”提供了具体机制,职责选择由 §18 的推导裁决。 AI 面向对象、要求、保持项和允许修改域;内核负责推导参数、搜索允许的结构、选择求值方法并解释结果。发现与说明是这份可执行语义的任务相关投影。系统承担从设计关系到实现的推理,新增抽象保存前提与展开;实际模型收益不由架构名称或工具数量推定。
§18 已完成职责裁决,§22 给出明确参照域内的构造性可行性论证;架构选择不再悬置。每项转换仍须兑现适用条件与实现正确性,预算内成功率和总成本改善属于待验证的经验主张,不以“对所有 CAD 问题最优”作为研究前提。
创新与复用按问题划界。线性代数、LP/MILP、成熟 NLP、通用实体求交与拓扑算法使用适用的成熟实现;AI 设计语言、关系合成、能力发现与组合、诊断恢复和受验证约束的能力演化允许自主研究与重构。不要求先穷尽开源库或证明不存在相似实现,才允许设计新架构;也不保护现有工具、特征树或薄适配形式。 一份语义权威与一致执行是防止矛盾的要求,不是冻结现有接口的理由。
已有 能力发现研究 和 RFC-0002 已提出渐进发现、状态相关能力和 Task Capsule。本文不将这些重新命名后当作突破。新增研究主张是:让关系语言同时承担设计表达、实现合成、能力解释和经验积累,使 AI 不必先猜对施工程序。
16.2 当前实现把哪些负担转嫁给了 AI
Section titled “16.2 当前实现把哪些负担转嫁给了 AI”本节依据当前源码,以及 Node 24.19.0 上对现有已构建共享 SDK 的只读执行。AI SDK 7.0.91、Zod 4.1.8、Ajv 8.20.0;计划版本 aira.exact-cad-plan/0.22.0。没有调用模型提供商或修改 CAD 模型。源码与 dist 分别指纹记录,未重新构建;不能把本实验当作浏览器产品验收。
| 发现 | 实际证据 | 对 AI 的负担 |
|---|---|---|
| 需求词与高层计划能力断开 | SDK 查询 holes、equally spaced holes with edge margin、assembly distance 均未返回 plan;精确 hole-array、set-product 能返回 |
AI 要先知道内部 kind,或自行从底层几何库拼出方案 |
| 内部说明与共享执行不一致 | 说明给出 resources:true,实际 SDK 拒绝;resources:{} 接受。说明中 morph、mindsEye、assemblyPlan 也被实际 read schema 拒绝 |
照说明调用仍失败,反复猜字段无助于理解 |
| 简写扩大了装配接受域 | set-product 简写列出 revolute、prismatic 等;实际只有 coincident、distance 两类关系;省略必填 solutionPolicy 同样被拒绝 |
AI 会把不存在的能力误认为已实现 |
| 事务说明矛盾 | capsule 同时称整个 plan 原子、每 step 独立提交;实际契约为后者 | 失败后难以决定哪些工作已经保留,可能重发已完成步骤 |
| 搜索结果与详情入口没有统一身份 | 原生 library search 转发 SDK,hole-array 返回 plan 且 entries 为空;library describe 却要求唯一 library entry |
从搜索结果继续发现的路径中断;这一项是源码推论,未调用真实 native describe |
范围必须区分:上述自然语言查询测量针对共享 SDK 的 library reference 入口;原生默认 scope 另有 operation module 搜索,不能据此断言所有入口都找不到建模操作。但 library scope 与 plan 的连接缺口、实际共享输入拒绝均可复现。
源码定位:计划投影与验证、库查询、read 契约、手写简写、内部 read schema、capsule 索引、原生搜索与详情。孤立的未知 kind 简写会被合法 kind 遍历过滤,本文没有将未暴露的字符串计作产品能力。
18 项隔离校验包括 7 个 read 输入与 11 个装配输入:read 的 3 个合法控制项接受、4 个错误项拒绝;装配 coincident/distance 两个控制项接受、6 种不存在的关节、2 个不存在的驱动字段和缺失 solutionPolicy 拒绝。接受仅表示输入契约合法,未解析真实对象或执行装配。未知关节的实际 SDK 简化诊断先提示缺少 distance 和 oneOf,未直接解释合法关系种类;诊断也需要按语义定位,不能仅压缩校验器报错。
这些缺口值得修复,但修复它们只解决“真实能力能否被正确理解”,不会自动产生新的设计合成能力。创新架构需要同时处理下一节的责任转移。
16.3 一份关系语义,生成求解程序与能力说明
Section titled “16.3 一份关系语义,生成求解程序与能力说明”能力单元定义为带类型的关系程序:
[ M(a)=\exists z\in Z_M(a),\ x\in X_M(a):\ \Phi_M(a,z,x). ]
其中 a 是对象角色、设计量、要求及允许修改域;z 是有界结构选择;x 是内部连续未知量;Φ 由已定义的关系组成。集合、量纲、量词范围、硬要求、偏好、保持项与效果具有明确语义。这个形式不声称所有 Φ 都可判定;每个能力同时声明可表达域、检查方法与预算内求解策略。
同一语义产生两个方向的结果:
- **给内核:**结构候选、变量参数化、约束与来源映射、几何构造以及最终检查。§5–§13 的数学路线承担这一方向。
- **给 AI:**能力解决的设计问题、接受的对象、需要决定的量、保持与改变范围、适用条件、结果证据和修复方向。接口不要求 AI 提供内核已经能推导的坐标、矩阵或求解器选择。
“同一语义”不等于生成器与检查器照抄同一预期结果。原始要求必须保存;检查器对最终实际几何独立测量。求解得到的孔中心不能同时作为唯一的检查真相,名称和自然语言说明也不能决定机器语义。
设计能力的契约至少保留以下内容;它们是内容要求,不是另建七个工具或冻结七种最终 schema:
| 契约内容 | 需要回答的问题 |
|---|---|
| 对象与目的 | 对什么对象实现哪类设计关系? |
| 量与关系 | 单位是什么,作用于哪些成员,净距还是中心距? |
| 选择权 | 哪些是硬要求、偏好、锁定项,哪些允许系统搜索? |
| 接受域 | 支持什么几何、结构与检查;缺的输入是什么? |
| 状态与引用 | 依据哪个模型状态,对象由宿主如何绑定? |
| 效果 | 成功改变什么,失败保留什么,提交单位是什么? |
| 证据与修复 | 哪些要求通过、冲突或未知,哪些修改仍合法? |
稳定接口不等于永不改变的工具表。现有 SDK、catalog 和 schema 投影可作为基线与可用组件;新关系架构可以重构它们。最终内置模型、外部 AI 与 UI 使用同一语义和执行能力,不永久保留等价旧路径。
16.4 发现应围绕目标关系,信息按当前决策展开
Section titled “16.4 发现应围绕目标关系,信息按当前决策展开”发现的目标是找到能产生所需设计效果的关系能力,以及它依赖的输入与准备动作。自然语言名称、同义词和例子帮助匹配;类型、单位、前提与效果确定能否组合。不能只按几何函数名字做文本排名,也不能用一次 embedding top-k 检索决定产品有没有能力。
首先提供可识别的用途、对象类型和适用范围;选择候选后展开完整契约与所需定义,再根据当前 Revision 绑定对象和已知参数。已知不适用、缺少可补输入、尚未检查应分开表达:尚无草图不意味着不能发现需要草图的建模能力,其准备路径也必须可发现。权限、陈旧引用、几何前提不能在摘要中隐去。
这个裁剪有明确的数学要求。固定需求 r,令 C(r,s) 是当前状态 s 对 AI 可见的信息,A(r,s) 是此时安全且能推进当前设计决策的动作集合。如果存在状态集合 S,使所有状态具有相同 C,却满足
[ \bigcap_{s\in S} A(r,s)=\varnothing, ]
则任何只看 C 的决策者都不能保证选出适用于全部这些状态的动作。此时必须展开信息或先查询,不能继续压缩。查询用于细化状态集合,不算上述已经完成的设计决策。该结论直接来自相同输入无法区分不相容决策,不证明 LLM 看见充分信息后必然能够推理成功。
例如同一句“加大孔距”,在孔中心锁定和孔中心可移动的状态中允许的编辑不同;隐藏锁定项会制造不可消除的歧义。应隐藏的是可推导施工量,保留的是影响设计选择的事实。
现有 exactCadPlanReference 已实现从同一 schema 选择 kind 并保留 $defs 引用闭包。实测按 JSON 紧凑序列化后的 UTF-8 字节统计,不能等同 token 或认知成本:
| 契约范围 | 字节 | 定义数 |
|---|---|---|
| 全部计划 | 149,142 | 100 |
| hole-array | 31,478 | 23 |
| set-parameters | 24,082 | 24 |
| set-product | 54,454 | 48 |
| linear-extrude + hole-array + require-hole-array | 32,993 | 23 |
完整共享 SDK 的 10 个工具 description 与 schema 合计 192,978 字节。只查 hole-array 比完整计划 schema 少约 78.9%,但仍有较大契约;不能由此声称 AI 成功率提高 78.9%。
附录 E 对 30 种合法 kind 的逐种投影、一个三 kind 组合、全量投影共 32 个范围检查了根规则、被选分支、保留定义逐项相等及引用闭合。另对 3 个合法孔阵列输入、7 个非法输入运行全量与投影 AJV,接受结果一致。对仅含所选 kind 的计划,保留相同根规则与所有引用定义即可保持该 JSON Schema 的接受语义;自定义语义检查、模型状态、权限及几何检查仍须由完整执行契约承担。这里证明的是可以按需给出真实契约,不是已经造出了更聪明的 AI。
16.5 完整设计例:AI 不再决定孔的施工坐标
Section titled “16.5 完整设计例:AI 不再决定孔的施工坐标”以下是拟议关系语义示意,不是当前工具已接受的 JSON 或现有 hole-array 的能力声明:
对象:指定安装板,以及其安装通孔集合 H要求:|H| = 8;所有孔直径 = 6 mm 所有不同孔对的孔边净距 >= 3 mm 每个孔到板边的净距 >= 4 mm修改:板宽 = 40 mm;板高 = 30 mm允许:在已声明结构语法中重新安排这些孔的位置与排布保持:孔数、孔径、其他持久要求及未授权修改的对象原生发现应使 AI 在不知道 hole-array 名字时也能找到相应关系能力,读到其世界方向、板域与通孔检查限制。对象身份从宿主当前读取获得。AI 决定这些要求和允许修改范围;坐标与结构候选由内核负责。
对矩形 4–4 排布,名义条件要求板宽至少 41 mm,因此 40 mm 排除这个分支。若声明语法也允许对称 3–2–3,§13.1 的参数化把 16 个坐标变为 p、h,两者可取 9、7.8 mm。实际几何检查通过后,系统一次提交这个求解步骤的候选,返回新的排布和逐要求证据。AI 无须计算 16 个数、删除旧孔、选择面索引或安排布尔顺序。
当前 regular hole-array 仍要求每轴固定 count 与规则,不支持将这一整套请求自动合成为 3–2–3。 这正是应新增的关系合成能力,不能用改说明或包装现有工具冒充完成。新能力允许重构现有表达和编译组织;数值与几何基础算法继续使用成熟实现。
当结构被明确锁成 4–4 时,系统返回该域内的宽度冲突及来源要求;不会擅自解锁改成三排。若其他允许分支未排尽,则保留 unknown 或继续预算内搜索;不能把一个分支失败当作整个设计不可能。结果中的修改范围、事务效果和证据与发现时同属一份能力语义。
16.6 从一次解法成长为可发现、可组合的能力
Section titled “16.6 从一次解法成长为可发现、可组合的能力”新增能力不应依赖每遇到一个产品就手写一个专用工具。关系语言支持带类型的对象角色、参数、组合与有界重复;不同产品通过组合表达。系统可以提出新的组合抽象,但其含义由可展开的关系程序决定。
- 从已验收的关系与实现轨迹中找出重复子结构,把具体对象换成角色、尺寸换成有单位参数。成熟程序压缩可用 Stitch;关系层归纳、参数域推导与诊断对应需要自主设计,不能假设程序压缩已经解决它们。
- 保存展开定义、参数类型、适用条件、影响范围和检查方法。成功样本提供候选,不自动给出全参数保证;未经证明的区域每次仍通过原始关系与真实几何验收。
- 失败记录分开处理:可核验对偶或符号推导可以形成带前提的剪枝引理;局部数值失败、超时或内核错误只能用于研究假说与策略调整。不能靠失败次数累计出“数学证明”。
- 给通过接纳条件的抽象产生用途名称、参数契约与可展开说明。名称用于发现,展开定义用于执行;诊断能回到内部具体要求。不能把未验证的生成代码直接发布成可信能力。
- 在独立组合与修改任务中比较净收益,将匹配、学习、展开和求解成本一起计入。若抽象增加选择歧义或搜索成本,应退出默认发现集合;已提交模型保留其语义定义,不因库更新而改变历史。
抽象积累旨在改善表达效率与预算内可解率,是否改善须计入匹配、选择、展开和求解的总成本后判断,也不自动扩大底层可表达域。遇到新的几何谓词、结构语言或检查能力缺口,需要真正新增语义与实现;这类自主创新不受已有宏库上限约束。展开深度、结构选择和求解有界,可解释的失败使系统知道缺的是表达、规划、几何还是验证,从而决定演进对象。
相对工具检索,新增的是从关系生成实现的责任;相对仅调整既定变量的约束模型,新增的是声明域内的结构与拓扑搜索;相对一次性程序合成,新增的是跨修改持久的设计语义和受验证约束的能力积累。这是本文提出的组合机制,不宣称它已被证明具有学术首创性。
16.7 论文依据、实现选择与判定实验
Section titled “16.7 论文依据、实现选择与判定实验”相关研究提供部件和证据,尚不能替代 Aira 的任务验证。研究 AI 操作 CAD 需要创新,不意味着相邻领域没有可用理论。
| 原始研究 | 对本设计的支持及限制 |
|---|---|
| EasyTool,NAACL 2025 | 支持用途说明与结构化参数说明分工。其 100 条人工错误分析中 GPT-4 参数错误率由原说明 17% 降至简明说明 14%,加一个例子为 1%;这不是 CAD 实验,也不能证明开放目录检索成功。 |
| ToolRet,ACL 2025 | 在 7.6k 查询、43k 工具的评估中,通用检索强不意味着工具检索可靠。支持保留类型/效果约束、准备能力与展开路径,不能依赖 top-k 文本相关性代表能力完整性。 |
| Synquid,PLDI 2016 | 提供由精化类型指导合成、尽早排除不合法组合的机制;64 项程序任务中关闭 round-trip 检查有 33 项超时。不是 CAD 或 LLM 成功率,本文不引入整套合成器。 |
| LILO,ICLR 2024 | 将程序压缩与可解释名称/文档结合,说明抽象“能压缩”与“能被模型使用”是两个问题;其任务为字符串、场景推理与图形组合,未证明机械几何编辑可靠。 |
| 抽象解释,Cousot & Cousot 1977 | 借鉴保守近似原则:不知道前提是否成立应保留未知;不能因为摘要未显示能力就断言它不存在。没有声称已为 Aira 构造完整抽象解释体系。 |
| 行为子类型,Liskov & Wing 1994 | 说明类型签名相似不足以保证行为可替代;能力组合与压缩必须保留前提、效果和历史性质。不是本方案整体正确性的引用证明。 |
实现选择按层确定:成熟数学与几何算法沿用 §3 的唯一底座;共享契约、现有 schema 投影、SDK 与验证器是已经可用的组件;关系语言、合成组织、关系抽象与任务相关契约编译由 Aira 自主设计。本轮不因这些架构职责而引入新的检索数据库、通用 Agent 框架或平行 CAD 执行器;也不将当前组件形状规定为新架构不可突破的约束。
为区分“说明变好了”与“系统真的承担推理”,采用同模型、同底层算子、同任务信息和总预算的 2×2 对照:任务相关工具发现 / 关系合成 × 普通轨迹宏 / 带适用域的关系抽象。留出任务包含同义表达、未展示的关系组合、保持其他要求的连续修改,以及越出抽象适用域的近邻输入。训练与留出按关系结构划分,不能仅换尺寸后称为新结构。
首要记录最终独立验收成功率、保持项破坏和错误接受;再记录首次正确关系表达、AI 补出的施工决策、语义错误、修复轮数、人工提示及完整成本。四组失败与 unknown 全部计入,不只比较成功样本。只有关系合成减少施工推理、提升新组合表现,且关系抽象进一步降低成本而不增加错误接受,才支持突破与进化主张。实验设计已明确,尚未调用真实外部模型执行该对照。
**研究交付状态:**本节机制、现有契约断层与可复现投影证据已形成;上述 2×2 是未执行的实验设计,§17.9 另记录已执行的有限内部 AI 试用。按用户最新裁决,本轮不继续扩样;§18 通过推导完成核心职责与架构方向选择。实验设计不构成实现前必须逐项跑完的任务清单,也不能被记作已测收益。
17. 根本问题:什么样的 CAD 核心更容易让 AI 操作
Section titled “17. 根本问题:什么样的 CAD 核心更容易让 AI 操作”17.1 研究对象与完成条件
Section titled “17.1 研究对象与完成条件”2026-09-20 用户明确指出:AI 的发现与理解能力和核心提供什么能力紧密相关,必须以寻找更适合 AI 的核心为根本目标。当前活动目标和状态只在工作进度维护;本节定义研究问题、比较方法和交付判据。
这里的“核心”包括设计对象的表示、基本能力、组合规律、编辑后的传播与保持语义、自动求解职责,以及失败时能得到的证据。它不等于底层几何库,也不等于工具调用的外壳。相同 OCCT 或数值求解算法可以承载不同的设计核心;改变这些上层语义仍是实质核心设计。
核心 K、其发现与交互方式 I、AI 模型 M、设计任务分布 D 和资源预算 B 共同决定实际表现,研究的是 (Performance(K,I,M,D,B))。不能脱离任务与模型,只凭“原语少”“抽象高”判定哪个核心更容易操作。人的施工习惯、当前 AMIR 和本文关系候选均不作为不可修改的前提。
研究完成须给出:明确前提与定义;从必要信息、编辑语义、组合性和复杂度得到的推导;具体架构职责、算法分工、适用边界及反例;已取得证据与尚未证明主张的区分。§18 据此完成方向裁决。局部试用可检查假设与实现事实,但不能替代推导,也不要求以遍历任务或证明跨所有设计、模型和预算的全球最优为完成条件。
17.2 必须改变和比较什么
Section titled “17.2 必须改变和比较什么”| 设计变量 | 核心问题 |
|---|---|
| 权威表示 | 对象由特征历史、参数程序、关系系统或它们的明确组合定义,AI 需要掌握什么才能修改? |
| 能力粒度 | 几何原语、通用操作、设计关系、领域组合分别把哪些推理留给 AI,哪些交给系统? |
| 组合规律 | 类型、单位、局部坐标、作用域、依赖与保持项能否一致组合,是否需要记住大量例外? |
| 编辑语义 | 改要求、改参数、改结构时,哪些关系自动保持,哪些选择必须由 AI 明确作出? |
| 求解边界 | 系统能推导哪些值、结构和修复,计算与歧义代价是什么? |
| 可观察性 | AI 能否从当前状态和诊断判断能力适用性、实际影响与合法恢复,而无需读实现? |
此前比较使用以下四类候选;§18 根据职责推导给出取舍,不再把四类标签的试用排名作为选型方法:
| 候选 | AI 主要表达什么 | 必须验证的可能优势与代价 |
|---|---|---|
| 特征/操作式 | 对象选择、操作及有序参数 | 精确控制与可预测执行;可能承担施工顺序、引用和依赖推理 |
| 程序式 | 带参数、组合、重复与变换的构造程序 | 统一组合与代码模型熟悉度;可能承担坐标、算法、效果及调试负担 |
| 关系求解式 | 对象、目标关系、保持项、开放变量与结构域 | 可能免除施工推导;也可能增加歧义、非凸搜索与诊断困难 |
| 有明确边界的混合式 | 关系约束目标,必要时指定实现或局部操作 | 可能兼顾表达与控制;必须付出跨表示一致性和学习多套语义的成本 |
方案要落实到可比较的具体语义,不能用四个标签代替设计。发现与说明必须暴露候选的真实能力;临时补 prompt 或写一个万能 solve 名称,不算改变核心。
17.3 如何知道收益来自核心
Section titled “17.3 如何知道收益来自核心”以下是主张具体 AI 使用收益时的实验解释条件,保留以防误读已有证据;不是本轮必须继续执行的实验清单。架构裁决以 §18 的推导为依据。
任务先于架构定义。 输入给出设计结果、原始要求、允许修改范围和检查精度,不给某候选专属的施工步骤。覆盖首次创建、连续修改、未示范关系组合、参数扰动、结构变化与失败恢复。共同可表达域用于比较使用难度;完整任务集另报能力覆盖,不能删掉某方案做不到的任务,也不能把更小的接受域当作简化优势。
说明与核心分开对照。 先测现有核心在当前说明与纠正后的准确说明下的差别,再比较各候选在质量相当的说明、发现入口和例子下的表现。同等质量指真实、完整、可获得且语义一致,不强行等字数。这样才能区分原有文档错误、发现缺口与能力体系本身的负担。§16 的资源字段矛盾等属于前一类证据。
模型经验单独记录。 使用独立会话,分别测首次接入与等量示例/学习预算后的表现;留出新任务族、关系组合和修改链。模型对代码或传统 CAD 的既有熟悉度无法完全消除,必须披露,并在条件允许时跨模型复核。某模型一次偏好某接口,不等于架构对所有 AI 更容易。自适应调参用过的任务不再充当独立留出。
把成本转移算完整。 AI 的发现、规划、补写施工细节与恢复成本,与系统编译、结构搜索、求解、几何检查、冷启动、缓存和学习成本一起报告。减少 AI 推理即使增加部分内核计算,也可能是有价值的取舍;需要由实际成功率、时延、总资源与维护负担共同判断,不能只比较 token 或单次调用数。
以实际设计验收裁决。 输入 schema 合法、一次调用成功、自然语言复述正确都不能代替要求满足。检查实际几何、被保护关系、允许修改范围、失败后的状态与恢复结果;保留 pass、fail、unknown、不支持及回退。正确拒绝与成功交付分开统计。公开共同失败来源,不能把生成器复述自己的答案称为独立判定。
17.4 裁决顺序与当前证据缺口
Section titled “17.4 裁决顺序与当前证据缺口”先由语义保持、输入责任、契约组合和计算复杂度推导职责分工,排除违反正确性与修改边界的方案,再选择具有明确算法路径与边界的架构。若主张具体成功率、发现与语义错误率、修复成本或延迟改善,则另需在可比条件下测量;适用分布、预算和统计方式不能在看见结果后为有利结论而更换。不用任意加权的单一分数掩盖能力退化。
§18 已得到统一语义、不同执行方法的分工:关系表达需求,编译生成施工见证,程序与特征支持构造及显式控制;边界由前向/逆向问题、可行域保持与组合推导说明。这不是以“混合”回避选择。内部计算成本、AI 输入义务与能力范围可以不同向变化,必须分别说明。
当前已有源码审计、契约接受性、数学降阶与几何构造证据,以及 §17.9 的四种封闭契约 AI 首答试用;后者不足以证明完整核心的发现、理解、连续编辑与成本优势。架构方向由 §18 收敛,这些经验收益保持未证,不再以追加试用为研究默认动作。研究由总览统一索引;本轮不启动产品替换或付费模型实验。
17.5 一个必要条件:核心必须保留足以决定合法修改的信息
Section titled “17.5 一个必要条件:核心必须保留足以决定合法修改的信息”数学推论,不是某个候选的胜出证明。 设原始设计为 D₁、D₂,同一修改请求为 e;Z 是整个执行系统获得的全部决策信息,包括核心持久语义、运行时状态、AI 上下文及可取得的外部要求。如果表示转换把两设计合并为完全相同的 Z,而满足各自要求的最终结果集合互不相交,那么只根据 Z、e 的执行系统无法保证在两设计上同时正确。确定性执行给出同一结果;相同输入下的随机执行也不能保证命中两个互斥的正确结果集合。
仅仅 AI 所见视图相同,并不满足这个不可区分条件。 核心完全可以在内部保留不同的 A/B 规则,让 AI 在两种设计上都调用 setWidth(100),由核心分别算出正确结果。AI 无需为此展开和理解全部内部关系。这正是值得研究的复杂度分工:语义由系统保留,传播由系统承担,AI 只需获得当前任务所需的可靠契约和反馈。
原始要求若仍可查询,信息也未真正丢失;若只存在于旧对话记忆,则独立的新会话不自动具有同样保证。整个系统都缺少区别信息时,正确行为是指出缺失并澄清,不能把猜中用户意图算作核心能力。
因此,压缩核心状态时,相同当前形状不足以作为设计等价条件。对声明支持的修改集合,系统必须保留能决定合法后继行为的语义,或能重新取得它们。发现界面可以只投影任务相关内容,不要求全部语义一并暴露。特征参数依赖、程序公式、显式关系均可能保存这些信息;实际如何组织,仍需比较 AI 的读取、表达和修改成本。
这也给“降低复杂度”一个可操作的方向:优先消除 AI 为实现要求而反复补写的坐标、顺序和传播规则;保留决定设计意义、允许选择与修改后果的信息。减少这类重复施工推理是候选收益,删掉必要的设计语义不是收益。
17.6 论文已经证明了什么,尚未证明什么
Section titled “17.6 论文已经证明了什么,尚未证明什么”以下均核查原始论文,而非依据摘要把重建、理解和编辑混为一种成功率。
| 原始研究与版本 | 可使用的证据 | 对本目标的限制 |
|---|---|---|
| CAD-Recode,arXiv v2,附录 F.1 | 将 SGP-Bench 的同一组 1,000 道题由 DeepCAD 转为 CadQuery,GPT-4o 选择题准确率为 82.4%;作者报告比附解释的 DeepCAD 表示约高 4%。 | 支持把表示作为理解能力的变量。模型既有代码经验、说明不同;不是四类核心的发现、创建、修改对照。主文 76.5% 对 63.2% 另含重建误差,不宜作为纯表示收益。 |
| HistCAD,arXiv v3,§5.3 表 6 | 完整约束与仅闭环约束的编辑可达率 ER 分别为 95.42%、95.92%;可达样本中的保持关系通过率 cPCSR 为 100%、67.51%,整体编辑成功 OES 为 95.42%、64.75%。 | 原有序列消融支持“几何可重建不等于意图保持”。直接 LLM 部分只有两个基础模型及两个变体的定性案例;没有受控测量陌生 AI 对不同核心的操作难度。 |
| neuralCAD-Edit,arXiv v1,§4 表 1 | 192 个编辑请求、384 次专家编辑、10 名设计者;GPT-5.2 有效模型率 0.99,专家接受率 0.25,人类基线接受率 0.78。 | 公开主实验使用 STEP 与 CadQuery 脚本迭代,不是核心表示对照;不能将差距归因于某个几何库。其专家验收可补充意图评价,不能替代 Aira 明确保持关系和权限的检查。 |
CAD-Recode 代码提供点云到 CadQuery 的研究实现;neuralCAD-Edit 代码提供公开评测与脚本执行流程。本轮没有安装或运行它们,不将其整套模型、代理循环和 CAD 库引入产品。HistCAD 的匿名代码入口未取得可审阅源码正文,不能声称已完成实现审计;其作者数据页说明公开的是子集,模态不保证逐项对应。
**本文推论:**既有研究足以否定“换什么表示都一样”和“几何有效就等于正确编辑”;尚不足以裁决 Aira 应选择哪一种完整核心。理解、生成、保持关系、端到端完成任务应分别测量,再联合判断。
17.7 实测:同一初始形状,不同正确修改
Section titled “17.7 实测:同一初始形状,不同正确修改”2026-09-20 在 TEMP 实际执行隔离探针,复现源码见附录 F。使用项目当前 OCCT 构件和附录 C 相同的 HiGHS 构件,未修改产品。这是作者编写的表示机制试验,不是 AI 自主操作试验,也没有实现四套完整核心。
共同板件尺寸为 80×30×4 mm;四个半径 3 mm 的通孔位于 y=15,x 为 10、30、50、70。孔边净距至少 3 mm,孔到板边净距至少 7 mm。相同初始几何可以来自两种不同的持续要求:
- A:四孔等距,两端净边距固定为 7 mm;改宽时可调整中心距。
- B:中心距固定为 20 mm,整组居中;改宽时可调整两端净边距,但仍不得小于 7 mm。
在 W=100 时,A 要求 x≈10、36.6667、63.3333、90;B 要求 x=20、40、60、80。单凭 W=80 的初始 B-Rep 无法决定哪一个是正确修改。
为避免故意削弱基线,本试验给特征式保留种子位置与阵列步长表达式,程序式保留公式和循环。四种机制都收到相同的 A/B 要求,全部通过同一个 OCCT 带内环棱柱构造几何:
| 机制 | 本次实际执行的语义 | 求解器未知量 |
|---|---|---|
| 参数化特征 F | 保存种子位置、步长与数量的参数依赖,修改输入后重算阵列 | 0;直接计算表达式 |
| 参数程序 P | 保存坐标生成公式和循环,修改输入后重算程序 | 0;直接计算表达式 |
| 线性关系 R | 为四个圆心保存边距、等距或固定间距、居中关系及不等式,调用 HiGHS | 4 |
| 混合机制 H | 关系系统求种子位置与步长,再由阵列展开 | 2 |
输入为 A/B × W∈{80,100,60,47,46},共 10 个不同输入、4 种机制、40 个评估单元,不是 40 个独立任务。验收从最终 B-Rep 的圆柱孔壁恢复圆心、半径、轴向和贯穿长度,再检查原始边距、间距和居中条件;同时检查实体有效、单实体、包围盒及体积。坐标数组自身通过不是成功条件。长度等数值比较容差为 10⁻⁷,本试验固定单位为 mm。
独立代数边界为:A 的步长=(W−20)/3,故 W≥47;B 的四孔跨距为 60,两端还需各 10,故 W≥80。该推导只针对声明的单排四孔结构。
| 机制 | 可行输入的实际几何及要求通过 | 不可行输入正确拒绝 | 错误结果 |
|---|---|---|---|
| F | 6 | 4 | 0 |
| P | 6 | 4 | 0 |
| R | 6 | 4 | 0 |
| H | 6 | 4 | 0 |
F/P 的拒绝来自共同要求检查器检查计算后的坐标;R/H 来自 HiGHS 不可行状态,并与上述独立边界核对。拒绝方式不同,不能据此宣称四者已有同等冲突解释能力。24 个可行结果均实际构造并检查了 B-Rep。另两个负对照在 W=100 继续使用旧坐标 10、30、50、70:两者实体均有效,但 A/B 意图验收均失败。
由此得到三个有限结论:第一,当前形状与未来设计行为必须分开验收;第二,F/P/R/H 配方均能表达这一族所需的再求值规则,不能凭“用了关系”断言更先进;第三,这个确定的前向问题可直接计算,通用 LP 并非必要。关系系统如能消元为直接求值,其收益来自正确编译;仍须在涉及逆向求解或结构选择时验证优势。
此试验没有独立留出、AI 编写、发现过程、真实原生 Interface 会话、模型存取、实际依赖传播、特征历史引用、事务或失败回滚。各宽度携带相同政策独立再求值,不能当作已验证的持久编辑链。表中的变量数是显式 LP 变量数,不是 AI 决策数或设计剩余自由度;本例各可行输入的解均已确定。每格仅测一次,输出中的时间只用于诊断,不报告性能排名或泛化成功率。检查器限于该平板贯通圆孔构造域;四机制共享同一几何实现,不代表当前产品已经支持这些持久表示。
17.8 从参数传播推进到结构选择的鉴别任务
Section titled “17.8 从参数传播推进到结构选择的鉴别任务”§17.7 已说明“会保持关系”不能单独区分四类候选。更有鉴别力的变量是:在何种边界内,由谁选择结构、推导参数、传播修改和解释失败。这些职责必须实际执行后记录,不能按接口标签归属。
下一组判定输入在此固定为:同样四孔、半径 3、厚度 4、高度 30、孔边净距≥3、板边净距≥7;允许的结构语法仅为单排 4×1 或矩形 2×2。
| 请求 | 独立正确条件 |
|---|---|
| W=30,两种结构均允许 | 2×2 可行,4×1 不可行;应交付符合要求的 2×2,合法坐标不唯一 |
| W=30,用户锁定 4×1 | 已声明域内不可行;不得擅自换为 2×2 |
| W=28,两种结构均允许 | 两个分支均不可行;不能推广为任意四孔布局均不可行 |
边界为:4×1 最小宽度 47;2×2 最小宽和高均为 29。所有候选得到相同结构语法、原始约束和底层算法;不给关系候选独占预先写好的尺寸分支。F/P 若通过程序或现有模式能力自动枚举并选择结构,应如实计为系统已经承担这项推理。这三项已作为 §17.9 的 T3 输入执行,结果计入该节,不计入 §17.7。
17.9 首次 AI 作者试用:四种封闭契约都通过,尚未拉开差距
Section titled “17.9 首次 AI 作者试用:四种封闭契约都通过,尚未拉开差距”本机实际执行;与 §17.7 的作者手写配方区别记录。 通过四个 fork_turns=none 的独立内部 Codex 会话,分别提供相同设计任务与各自契约;没有复制研究历史、候选答案或评估器。会话继承当前模型与设置,未指定另一模型,也未进行外部付费模型调用。每会话编写 T1–T5 共五份参数化设计,只提交一次;允许检查 JSON 语法,不提供几何/求解执行反馈。提示规定最长 8 分钟,但没有采集可比较的推理 token 或精确作者耗时,不能据此宣称等成本排名。
候选是 TEMP 中的有限语义原型,不是四个现成 CAD 产品:F 为参数化特征、阵列与分支;P 为纯 JavaScript 构造程序;R 为声明式几何、线性关系及分支;H 为关系求参数后使用特征构造。四者共同支持参数表达式;R/H 允许已知值直接计算而不调用求解器。F/P 没有自动 LP,表达式与程序可显式推导已知结构;所有候选最终使用同一 OCCT 构造器。不同原语是研究变量,不把效果一概归因于 JSON 与代码的语法差别。
| 任务 | 要求与核心责任 | 可行 / 不可行输入数 |
|---|---|---|
| T1 | 单排等距,精确保持两端净边距 | 5 / 3 |
| T2 | 单排固定中心距,孔组居中 | 5 / 3 |
| T3 | 授权域内选择 4×1 或 2×2;两者可行时优先单排 | 4 / 4 |
| T4 | 矩形板中的指定相位孔圆阵列,检查实际欧氏净距及每个孔的边距 | 5 / 3 |
| T5 | 固定孔距,反求区间内可行的最小板宽 | 4 / 4 |
每题公开一个示例,共五个;另有 35 个未给作者展示的参数变体,包括尺寸边界、孔数变化、锁定/空结构域、旋转后能放入而外接圆不能放入的阵列、空宽度区间等。共 40 个输入;不是每候选 40 次独立 AI 操作,而是五份首答产物的 40 次求值。 参数变体不等于留出新任务族。输入在父会话首次读取答案正文和评估前固定;F/P 已在此之前提交,因此不声称整个评估程序在所有作者开始前就完成预注册。
最终验收从 OCCT B-Rep 恢复孔中心、半径、贯穿长度和板件包围盒,同时验证单实体、有效性、体积、结构授权、几何关系与最小宽度。不可行标签独立按已声明结构域推导;没有用候选自己的 infeasible 声明充当真值。
| 候选首答 | 可行设计通过 | 正确拒绝 | 错误拒绝 / 意图错误 / 执行错误 / unknown | 实际 LP 调用 |
|---|---|---|---|---|
| F | 23 | 17 | 0 / 0 / 0 / 0 | 0 |
| P | 23 | 17 | 0 / 0 / 0 / 0 | 0 |
| R | 23 | 17 | 0 / 0 / 0 / 0 | 5,全部来自 T5 |
| H | 23 | 17 | 0 / 0 / 0 / 0 | 5,全部来自 T5 |
本轮共四个独立作者会话、20 份设计产物、160 个求值单元、92 次成功 B-Rep 交付。四组首答都正确,不进行胜者排序,也不能由零错误推出普遍可靠。全部原始答案保留,不向作者返回评估信息后重写。独立复核发现并修正了评估器自身问题:T3 曾额外要求任务未规定的单排 X 居中;网格判定曾使用较宽的取整容差;嵌套未知字段及非布尔条件未严格拒绝。修正后同一最终评估器统一重评四份原始提交,结果如表。没有把修评估器记作修复 AI 能力。
关键观察:候选名字不等于职责已经下沉。 四个作者都自行推导了大部分坐标公式、孔距边界和结构可行条件。R/H 的 T1–T4 都没有调用 LP;T5 虽调用 LP,作者仍写出了 width ≥ 2*edge+d+(n−1)*pitch,即先完成重要的几何到代数推导,再让求解器求一个变量的最小值。此次关系接口使优化可执行,但没有证实它免除了 AI 的这部分施工推导。
**局限与裁决:**这是已给完整任务和契约的封闭首答试用,不包含自主能力发现、文档质量消融、交互修复、模型存取、历史稳定引用、真正修改链或跨模型复核。任务均为可手工推导的板件孔阵列,四组出现正确性饱和;不能据此选定通用核心。执行保护也非等预算:P 整函数限 100 ms,其他候选每个表达式限 100 ms,LP 成本另计,因此诊断时长不用于效率比较。没有以输出字节数代替认知成本。完整任务、契约、首答、样本生成和最终评估器集中保存于附录 G,可重放产物验收;模型重新采样不保证生成相同答案。
17.10 这次试用改变了什么判断
Section titled “17.10 这次试用改变了什么判断”本轮这批任务的正确性结果未能区分候选。只增加同族尺寸样本,并不会自动提高架构区分力。§17.9 支持在这个范围内保留参数化特征和程序作为有效基线,不能将其弱化为鼠标模拟、固定坐标或无阵列接口来制造关系方案优势。
需要检验的突破点进一步明确为:AI 能否直接表达设计对象之间的要求,以及允许系统选择的部分;核心能否据此生成正确的数学问题和构造,而不要求 AI 先手写坐标公式与可行域。 只提供低层 LP 系数接口没有完成这一步,单纯换成声明式 JSON 也没有完成这一步。
这要求候选原语至少具有明确的对象域、保持/变化语义与可编译关系。例如“孔组在板内并留边”“相邻净距”“对称或居中”“锁定结构/开放结构”可以作为关系编译的研究对象;不能只为 T1–T5 逐题内置答案。通用关系的适用域、组合后的求解分类、退化与歧义处理仍须给出数学边界。模型已知的量可经消元或直接求值执行,未知量才交给适用的成熟求解器;这是一项待验证的编译职责,不是要求所有任务调用全局优化。
本轮试用没有裁定“关系式获胜”。用户进一步要求停止逐例测试、进行推导;§18 从必要语义和求解责任回答上述问题,作出架构裁决。试用保留为证据,不再承担通过扩样选出通用核心的任务。