Laya 自部署研究与 Jev/Aira 适配评分
Scope note (2026-09-28): the user has obtained Jev Early Access and selected Jev for current development. Laya self-hosting and fully offline AI are deferred. This study remains research evidence, not an active deployment commitment; current execution scope is owned by #335, #355 and #368.
日期:2026-09-27;2026-09-28 补充团队复核(§8)及开放权重架构价值与上游差异(§9)。性质:公开资料、固定版本源码和三路 agent 讨论的综合研究;没有下载权重、执行模型推理、付费调用、部署或修改产品运行时。Aira 初次源码核查基线为 792ac788,此前 Jev 架构研究的基线为 881e5a91;下述版本表是初次快照,新上游差异见 §9.2。
技术可行性结论:公开权重、加载器、HTTP 服务和宽松许可证提供了自行部署 Laya 的路径。当前已选择 Jev 开发,Laya 本地验证暂缓;以下保留其技术依据,不作为当前执行安排。 本机 Apple M5/16 GB 可作为单检查点 CPU/MPS 试研候选;能否与 Aira 几何计算稳定共存、实际延迟和峰值内存仍未验证。
Laya 的主要价值是私有部署、检查权重与推理实现、领域微调和控制服务生命周期。Jev 的主要价值是托管交付、较大的输入及候选容量、已有的类型化决策契约。当前预训练模型提供有界问题的语义判断;该输出本身不能替代开放候选生成、关系求解、几何验证、授权或提交事务。Aira 可进一步联合研究候选表示、判别编码、搜索与澄清策略和领域适配,不以当前 API 的打分接线方式冻结架构,见 §9.1。
本文初次快照的决策支持评分为:近期接入 Jev 59/100、Laya 51/100;私有可控路线 Jev 42/100、Laya 66/100。分值不是准确率、成功率或性能测量,也不是研究优先级或技术潜力的裁决;低于满分的重要原因是双方都没有本项目 CAD 留出实测。权重、逐项依据和硬性条件见 §5;当前安排只见 GitHub 计划。
2. 固定证据与模型边界
Section titled “2. 固定证据与模型边界”2.1 本次核查版本
Section titled “2.1 本次核查版本”| 对象 | 固定版本与一手来源 | 核查范围 |
|---|---|---|
| Laya 推理代码 | GitHub 4066d5d5fbf08b66c6757ddeedbd797bd7655bc0;pyproject.toml 为 0.3.20 |
Python ≥3.10;torch、transformers 等依赖是下界范围,不是完整锁文件 |
| Laya 权重包 | HF 55cf4c4ebb4ebe31b2550e8bdf3bd21b99753851 |
无 gated 限制;读取卡片、目录与配置,未加载权重 |
| Jev | jev-1.13.0,JS SDK 0.6.0 |
托管模型;SDK 发布包核查见 Jev 集成研究 |
| Aira | 792ac788 |
核查持久任务、提交后持久化及 usage 路径;没有运行时接入 |
2.2 不能把三个检查点混成一个模型
Section titled “2.2 不能把三个检查点混成一个模型”| 检查点 | Backbone/规模(上游报告) | 配置 max_len/head_max_len |
对 Aira 的含义 |
|---|---|---|---|
| 根目录/english | ModernBERT-large;含决策头约 421M | 512/192 | 英文短状态候选;不能作为中文默认 |
| multilingual | mmBERT-base;约 322M | 1024/256 | 中文试研优先候选;多语言覆盖不等于 CAD 语义已验证 |
| typed-decisions | ModernBERT-large;约 421M | 1024/256 | 针对四类工作流微调;不是 CAD 专用检查点 |
配置分别来自固定 HF 包的 root、multilingual、typed-decisions。模型架构和默认路由见 router.py。typed-decisions 默认不参与自动任务路由,需显式启用;中文试研应固定 multilingual,避免混合语言、JSON 键和短文本影响自动选型。
2.3 输入与置信度的源码事实
Section titled “2.3 输入与置信度的源码事实”Laya 是 encoder 加决策头,输出 Choice、Score、Noul,不生成任意自然语言或 CAD 程序。build_sequence 会裁剪题干、选项和 state:单选项先限制为 48 tokens,预算不足时进一步缩短;state 的剩余空间由实际题目编码占用决定。不能把 1024 简化成可完整读取 1024-token 工程状态,也不存在“少于 20 个选项必然安全”的保证。 保留候选标记不等于保留了区分候选的完整文本。固定 common.py
predict_long 提供分窗聚合,但窗口级最大概率不是整份文档的校准概率;例如 Noul 的逐窗取最大值会随窗口数量改变统计行为。把窗口放大或把候选分级也会改变问题与资源成本,必须重新评价。固定 agent.py
特别注意:Choice/Score 的 confidence 是 1 − H(p)/log(k),而 answer_confidence 是 max(p);Noul 的两个字段均为 max(p_true, 1−p_true)。Score 本身返回等级位置的期望值,不是整数分类标签;answer_confidence 也不是“这个期望值精确正确”的概率。温度缩放或 proper scoring 训练不能证明 CAD 域外校准,任何通用阈值都不能成为自动提交授权。概率函数、答案解码
3. 与 Jev 的综合比较
Section titled “3. 与 Jev 的综合比较”| 维度 | Jev | Laya | Aira 决定 |
|---|---|---|---|
| 角色 | 给定 state 的类型化判断 | 同类有界判断;开放推理实现 | 都放在候选生成与确定性检查之间,不替换建模核心 |
| 输入容量 | 请求总量 64k,state+最长问题 32k;Choice ≤255,Score ≤10 | 默认短窗口并裁剪;HTTP Choice ≤100、Score ≤32,但能接收不等于完整理解 | 按依赖切片;候选缺失、超预算时保留扩展/澄清路径 |
| 中文与 CAD | 有公开语言/任务证据,CAD unknown | 有 multilingual;CAD unknown | 不按英文工作流成绩推定中文建模能力 |
| 几何正确性 | 无几何证明能力 | 无几何证明能力 | 仍由 @aira/geometry-kernel 和现有检查负责 |
| 私有部署 | 未找到公开权重或自托管指南;商业专有方案 unknown | 权重、代码、HTTP/ONNX 路径公开 | 离线是硬要求时,公开 Jev 路径不满足,不能靠总分补偿 |
| 微调与可审查性 | 权重不公开;SDK 开源不代表模型开放 | 可审查、微调和固定模型,但需自有数据与校准 | 潜力计入可控性,不预支未来 CAD 成功率 |
| 运维 | 供应商托管;网络、配额和版本可用性依赖外部 | 自担模型加载、资源、并发、安全、升级和故障恢复 | 先小规模测量,再选 CPU/GPU/托管方式 |
| 成本 | 当前公开输入价 $0.042/Mtok、输出免费 | 无逐次供应商 token 费;硬件、能耗、运维和训练有成本 | 比较端到端达成任务成本,不能说自托管免费 |
Jev 契约及价格来自 官方 models,其限制见 jaggedness。Laya HTTP 限制来自 固定服务实现,不同 API 层的限制不得混为全模型统一限制。
3.1 公开 benchmark 能说明什么
Section titled “3.1 公开 benchmark 能说明什么”上游 BENCHMARKS 明示:Jev 数字引用第三方结果,未在同一运行中调用,样本和 prompt 可能不同。下表均为上游报告,不是 Aira 复测。
| 证据 | 数字/范围 | 允许的结论 |
|---|---|---|
| typed-decisions,400 cases/2000 decisions | 专用检查点 accuracy .766;root .361、multilingual .352;多数类 .461;引用 Jev .727 | 微调价值值得研究;不能推出 Laya 比 Jev 更适合 CAD,也不能说 CAD 准确率只有 .36 |
| 同一 typed-decisions 表 | 专用检查点 ECE .213;引用 Jev .144 | 不能把别处温度重拟合的 .081 移到这里宣称校准胜出 |
| MASSIVE 中文,20 选项,100 cases/语言 | zh-CN root .620、multilingual .630 | 中文并非普遍不可用;仍不是 CAD 数据,更不是保证 |
| T4 单问题 | multilingual p50 32.8ms | 表明本地 GPU 低延迟的可能;与远程 Jev API 的网络时延不能直接计算公平加速比 |
| 4 核 EPYC/16GiB CPU,每行 10 次计时、2 次预热 | multilingual 1题 193ms、10题 1842ms;english 1题 580ms、10题 6244ms | CPU 批量未必便宜且快;这些数值不是本机 M5 预测 |
训练脚本使用命名 train/test split,只能说明该脚本的划分方式;本轮没有审计全部基础训练数据、语义重复或污染。训练时间、语言覆盖、ECE 和 benchmark 标题都不能升级为独立 CAD 留出证据。公开报告中同一指标也有不同运行和包版本,应固定原始输入与配置后再比较。
3.2 “只换 URL”不成立
Section titled “3.2 “只换 URL”不成立”| 固定源码观察 | 影响与处理责任 |
|---|---|
/v1/systemone 有相近 JSON 外形,但未知 model(包括 Jev ID)会落入自动路由 |
Aira 必须显式指定 Laya 检查点;不能保留 jev-1.13.0 后误以为固定了模型 |
Agent 响应 model 为通用 laya-rl-agent;Router 增加 routing;revision 另有加载状态 |
响应 model 字符串不足以追溯权重。启动身份应绑定代码、权重 revision、配置/温度、tokenizer、运行后端 |
revision pin 和 SHA-256 校验是可选;默认加载不会自动套用 PINNED_REVISIONS |
固定 SHA 必须落实到加载入口;默认 CLI 环境配置没有直接接上 Router 的 revision 参数 |
| Laya Noul 带 confidence,Jev Noul 契约无该字段;同名字段也有统计含义 | 不能直接搬用阈值;保留供应商原始语义和类型,不伪装成相同校准尺度 |
| Laya usage 累加实际编码题目行的 attention tokens | 字段名相同不代表计费等价;不要乘 Jev 单价估算自托管成本 |
HTTP 错误常为 detail;400/401/413/422/500/503 有不同原因 |
验证现有客户端的失败路径;未实测前既不能说完全兼容,也不能断言 SDK 必然崩溃 |
以上分别对应 serve.py、agent.py、revisions.py。HTTP 外形兼容只是减少部分接线工作,不保证 SDK、语义、费用或行为兼容。
4. 自部署的完整判断
Section titled “4. 自部署的完整判断”4.1 许可与数据来源
Section titled “4.1 许可与数据来源”运行库 LICENSE 为 Apache-2.0,HF 模型卡也声明 Apache-2.0;backbone 的 ModernBERT-large 标 Apache-2.0、mmBERT-base 标 MIT。这些材料支持自部署及商业集成的许可路径,分发时需履行通知、许可等条件;不等于已经证明全部训练数据权属清洁或获得担保。
LocalLLaMA/typed-decisions 卡片声明 Apache-2.0,但基础训练混合数据的逐项来源审计未完成。Aira 自有操作轨迹也不是天然可训练:须具有用户数据使用权,区分用户意图、采纳来源和几何检查标签;几何 pass 不能充当意图正确标签。
按当前公开 TypeSafe MCA §2.3,服务或输出不得用于模型蒸馏、模仿或开发相似/竞争产品。因此不将 Jev 答案、概率或其派生标签送入 Laya 训练;“先用 Jev 再训练本地替代”不能当默认计划。有单独企业协议时以实际约定核实;本研究没有获得任何豁免。
4.2 硬件、离线与运行方式
Section titled “4.2 硬件、离线与运行方式”| 方式 | 可行性依据 | 尚缺证据/代价 | 建议 |
|---|---|---|---|
| 本机原生 Python,M5/16GB | 加载器含 CPU/MPS 选择及部分回退路径;检查点为数亿参数 | 峰值 RSS/统一内存、长输入、热降频、几何计算争用均未测 | 首选隔离环境、单 multilingual、短输入、低并发试研 |
| 内网 Linux CPU 服务 | 有 CPU Docker 路径;公开 CPU 基准 | 批量可能秒级;多进程复制模型内存;真实队列尾延迟未知 | 适合低请求量验证,不预设 4核/8GB可跑多实例 |
| Aira 托管 GPU 服务 | CUDA 及可选 TileLang 路径,公开 T4 基准 | 常驻费、利用率、并发隔离、运维、CUDA 依赖和精度对照 | 在业务量和端到端收益成立后选型,当前不租赁/部署 |
| Node/浏览器 ONNX | 仓库提供 laya-ts、导出和 CPU/WebGPU 路径 |
需导出模型、核对数值;下载/缓存体积、浏览器内存、支持范围未测 | 后续分发候选,不作为已验证的即装即用能力 |
CPU/MPS/CUDA 路径见 Agent 加载器,ONNX 见 laya-ts。本机原生 MPS 与 Docker 中 Linux CPU 是两条不同运行路径,不能把 Mac Docker 当作已具备 MPS 加速。
根权重文件约 0.84GB,多语言权重约 0.65GB,文件大小不是峰值内存。还要计入精度展开、临时权重、激活、batch、tokenizer、Python/torch、编译缓存与 Aira 现有占用;本轮不承诺“1GB常驻”或给出未测的最低 RAM。公开 CPU benchmark 的整脚本峰值 9.3GiB 涉及最多五个已加载模型,也不能当成单模型要求。
2026-09-28 客户端可行性复核:固定源码 9d955671415fc19f069b9cc998928075c1f255ec 的上游 CPU 基准在 AMD EPYC 9R14、4 个物理核、16GiB RAM、fp32 上报告 multilingual 单题 p50 为 193ms、10 题为 1842ms;每格只有 2 次预热和 10 次计时。它支持“无需独立显卡也有实际运行路径”,不证明普通客户机的最低配置、长输入尾延迟或 CAD 同时运行体验。9.3GiB 仍是多检查点脚本的峰值,单 multilingual 的峰值未知。完整安装还包括 tokenizer/config、Python、Torch 和实际解析的依赖,其磁盘占用尚未测量。
资源裁决须区分单 Laya、CAD+Laya、生成模型+CAD+Laya。前两者通过不能证明完整离线 AI;Laya 的有限候选判断不能承担开放式生成职责。16GB 无独显机器可作为待确认的首个客户配置候选,不是已支持配置。分别观察加载峰值、常驻内存、系统交换/统一内存压力、队列和端到端时间;Apple 统一内存不能重复计入 RAM 与 VRAM。小样本不足以承诺 p95;显存最低值、整机购买预算和本地 CAD 语义质量目前均未获得 Aira 实测依据。本轮未下载权重、安装模型依赖或执行推理。
HF 包含 encoder config 和 tokenizer;加载器可从完整本地目录构建模型并装载 safetensors,支持无模型运行时外网依赖的路径。缺文件时存在远程 fallback,故离线结论仍须通过预置完整固定文件、依赖缓存及 HF_HUB_OFFLINE=1/禁网实跑确认。不能把“目录看起来完整”写成已经断网验收通过。本地加载与回退
4.3 服务已有保护与需要补齐的边界
Section titled “4.3 服务已有保护与需要补齐的边界”laya-serve 默认绑定 0.0.0.0:8000,Bearer key 可选;本地试研应绑定 loopback。服务已有认证比较、2MiB body、50,000 字符 state、64 问题、候选总量上限、默认 16 个入场请求和超额 503;单执行线程串行推理。它不是完全没有防护,也不是生产多租户网关。 没有可据此宣称的端到端请求时限、租户隔离或取消后立即终止原生推理保证。单纯提高进程数会复制模型并增加内存。服务源码
默认预加载与 Router 的惰性加载策略不同;试研需要显式只加载一个检查点,并防止请求触发其他模型加载。版本固定、就绪探针的真实推理、队列总时限、503 的重试上限和故障回退应在现有 Aira 服务路径承担,不再建立第二套 CAD 执行器。健康接口返回 ok 不证明业务输入可成功推理。
Dockerfile 使用 Python 3.11 镜像标签及 torch 2.14.0 参数,但基础镜像不是 digest pin,其他 Python 依赖仍是范围。现成 Docker 配方不是完整可复现环境;应固定镜像、实际解析依赖及模型 artifact。模型版本固定也不保证跨 CPU/MPS/CUDA 的浮点输出逐位相同。
4.4 成本:什么时候可能划算
Section titled “4.4 成本:什么时候可能划算”设每月 N 次请求,每次 Jev 实际计费输入 T tokens,则当前公开价下 C_jev = N × T × 0.042 / 1,000,000。自部署为 C_laya = 固定硬件或租赁+能耗+带宽存储+运维+训练/标注/校准摊销+N×边际成本。两边还需加生成模型、几何求解、重试与人工澄清成本;问题数、usage 字段和实际计费 token 不应互相替代。
仅作算术情景:T=1000 时每次 Jev 输入费为 $0.000042;若自部署固定投入假设 $100/月、暂忽略边际成本,需约 238 万次/月才抵平这项 API 费。$100 不是云报价;在 10,000 tokens/次时阈值缩为约 23.8 万次。已经拥有的闲置硬件会降低现金增量,但不消除资源占用和维护成本。因此当前没有“自托管必然更便宜”的证据;隐私、可控性或离线需求可以独立成为采用理由。
5. 适配评分:透明权重,不冒充实测
Section titled “5. 适配评分:透明权重,不冒充实测”评分对象是现有公开版本作为 Aira 语义判断组件的适配度。0=当前公开路径不满足,1=重大缺口,2=部分满足且缺证据,3=有可用依据但需本项目验证,4=较强契合,5=该维度直接满足。Jev 自托管计 0 表示未提供可采用的公开路径,商业未知不等于客观不可能;双方未测的实际 CAD 能力不被当成已通过。半分和小数精度不提供额外信息,故只给整数档。
| 维度 | Jev 0–5 | Laya 0–5 | 近期权重 | 私有可控权重 | 评分理由 |
|---|---|---|---|---|---|
| 开箱语义决策证据 | 3 | 2 | 25% | 10% | Jev 有较广任务证据;Laya 对检查点/任务更敏感;两者 CAD 都 unknown |
| 上下文与候选容量 | 4 | 2 | 15% | 10% | Jev 容量较大;Laya 默认窗口和标签裁剪明显 |
| 概率诊断与校准准备 | 3 | 2 | 10% | 10% | 都需域内验证;Laya 同名 confidence 混合尺度、温度配置需更细核验 |
| 当前接线与契约工作量 | 4 | 2 | 15% | 10% | Jev 有已核查 TS SDK;Laya 还需模型身份、服务环境与协议差异接线 |
| 自托管/数据不出域 | 0 | 5 | 10% | 25% | Jev 无公开权重路线;Laya 文件可本地持有与运行,禁网验收仍未执行 |
| 自有数据微调与控制 | 1 | 4 | 5% | 15% | Laya 有开放训练路径;数据、标签、收益未被证明 |
| 部署运维负担 | 4 | 2 | 10% | 5% | Jev 托管;Laya 需要自身承接资源和服务可靠性 |
| 当前成本依据 | 3 | 3 | 5% | 5% | Jev 有明确单价;Laya 有资源可控性但没有本项目 TCO,双方不预判输赢 |
| 实现可审查与复现控制 | 2 | 4 | 5% | 10% | Jev SDK 可查但模型封闭;Laya 可固定代码权重,依赖与后端仍需锁定 |
| 总分(Σ权重×分值/5) | 59/42 | 51/66 | 100% | 100% | 顺序为近期/私有可控 |
权重反映两种产品取舍,非统计估计。近期分差只有 8 分;“开箱语义证据”一档变化就影响 5 分,因此不能据此宣称稳定优劣。私有路线分差来自已经存在的权重控制能力,不是给未来微调效果打分。生产自动提交、硬离线、真实权限隔离等条件必须逐项满足,不能用加权平均抵消。
6. Aira 接入边界与后续验证设计
Section titled “6. Aira 接入边界与后续验证设计”沿用 Jev 深度集成架构:开放生成/原生能力发现提出候选,模型判断语义适配,关系编译与几何核心产生工程证据,统一事务路径提交;UI 和公开 Interface 共享权威能力。首个接线切片替换判断实现,但这不是长期架构上限:候选表示、判别编码、探索与澄清策略可以联合演进,不复制工具声明,也不新增竞争的可写设计状态。
初次源码基线的持久化观察需要按当前版本修正(详见 Jev 研究 §11):DesignTaskRepository.putTask 不是带预期版本的 CAS 接口;committed-state.ts 当前已 await 任务写入并传播错误,但仍在几何提交之后另事务保存;live-workbench-controller.ts 的后台任务写入仍吞错;usageSnapshot 仍按单套模型价格累计。这里是相关接入缺口,不声称全部事务都无 CAS,也不因调研而扩大运行时重构。
模型建议绑定其输入状态与候选身份,过期结果不可用于新 Revision。已提交设计的重放依据持久设计语义和当前合法绑定,不重新询问更新后的模型来解释历史。模型更新应产生新的建议,经过显式验证/接受;它本身不是静默改写已提交设计的理由。Laya 的权重 hash 是推断来源,不是几何正确性证书。
若用户下一步授权本地验证,首轮只处理“中文/中英混合的有限设计解释选择”,不先宣称完整智能改善。使用现有 tools/capability-explorer 与真实原生 Interface,不新建 test/spec 或并行建模执行器。拟采用以下可复现设计,本轮均未执行:
| 项目 | 首轮范围 |
|---|---|
| 需求分布 | 未来编辑语义、语义引用消歧、候选均不匹配/需澄清,各占 1/3;中/英/混合各占 1/3;不由候选模型的操作序列反向定义任务 |
| 样本与划分 | 90 个任务组探索+90 个独立任务组留出;按设计模板/来源划分,seed=20260927;同一几何或措辞变体留在同一组,不能一边调参一边继续称留出 |
| 参数 | 每组 2/5/10 候选;状态约 128/256/512 tokens 档;记录各模型真实 tokenizer 长度、题干与选项被裁剪情况;另设边界超长样本,不能丢弃失败 |
| 真值和误差 | 意图标签来自预先明确的需求/独立人工裁决;几何按现有原生检查容差,不另放宽;不可判定为 unknown;几何通过与意图通过分别统计 |
| 资源预算 | 本地单 multilingual、并发1、至多2小时;每请求总时限10秒,每任务端到端60秒;任务失败和回退均计入。是实验预算,非承诺 SLA;付费 Jev 对照需另获授权 |
| 对照与判定 | 先固定相同状态和候选比较现有生成基线/Jev/Laya 的判断,再在相同端到端预算下比较完整流程;不要同时换模型、候选数和策略后归因模型 |
| 统计与成本 | pass/fail/unknown、错误接受、覆盖率、Brier/ECE(标明样本与分桶)、任务成功、回退、p50/p95、峰值内存、总费用;报告样本量和不确定性,不用脚本通过率代替 AI 自主成功率 |
独立核验项包括标签置换、真正答案缺失、相同形状但不同未来编辑、缺失工程证据、过期 Revision、超预算截断、禁网重开、冷/热加载及与几何计算并行时的资源争用。人工偏好未知时不得用模型自信补真值。若目标是智能收益而 Laya 无法在约定资源与误差边界内改善任务结果,就保留同一架构中的原判断策略,不为采用模型重写需求或删除反例;硬离线/数据边界目标按 §8.4 的质量和资源门槛判断。
7. 三路 agent 讨论与主审裁决
Section titled “7. 三路 agent 讨论与主审裁决”本轮通过 Orca orchestration 分派模型证据、部署协议、Aira 适配评分三路研究。模型与适配 worker 实际交换了训练标签来源问题;部署 worker回复了模型身份和协议差异,部分回复晚于另一 worker 完成,由主审交叉核对源码裁决。临时报告不作为额外版本化报告树保存。
| 讨论/分歧 | 主审裁决与依据 |
|---|---|
| 模型 worker 倾向“零样本接近随机,所以 CAD 不可用”;适配 worker 也引用中文小样本负例 | 不接受外推。typed-decisions 的低分只对该任务成立;MASSIVE 中文有另一组结果。CAD 标 unknown,不能捏造 .36 准确率或中文全面失败 |
| 部署 worker 认为“接口相同,只换 URL”;另担心错误格式必然使 SDK 崩溃 | 两个绝对判断均不采纳。模型 ID 会被忽略、confidence 含义不同、usage 不同;错误处理需实测。见 §3.2 |
| 模型与适配 worker 同意用 Aira 采纳和几何结果训练;提议绕开 Jev 蒸馏限制 | 接受独立来源方向,不认定数据天然合法或标注完备。用户采纳、意图和几何检查必须分别有来源;不使用 Jev 派生标签 |
| 部署 worker 估计约1GB常驻、低成本高吞吐;模型 worker 给延迟满分 | 删除无实测的容量与吞吐承诺。CPU 数据已有秒级批量表现,M5 未测;成本使用公式,性能不授满分 |
| 适配 worker 将某结构化 helper 的32项限制当成全模型上限,提出模型升级重算历史 | 修正 API 分层限制;拒绝升级模型后重新解释历史。已提交模型语义保持权威,新的建议需另行验证和接受 |
| 是否现在采用 Jev+Laya 双模型流水线 | 不预设必须串联两者;这会增加延迟与运维。先把同一判断职责做可比验证,再决定单一部署方案或确有收益的分工 |
三路任务均已完成,主审已读报告、复核关键源码并释放 worker。完成的是研究和评分;离线运行、SDK 互通、CAD 泛化、负载、能耗和商业部署完整数据来源审计仍为 unknown/未验证。
8. 2026-09-28 团队复核:可替代职责与采用边界
Section titled “8. 2026-09-28 团队复核:可替代职责与采用边界”本次重新读取官方协议及固定 Laya 源码,并与架构、Aira 当前实现两组交叉质询。没有下载权重、执行推理、安装依赖、部署服务或进行运行验收。§5 分数仍只是显式权重的决策辅助,不作为采用或发布门槛。架构与提交一致性由 Jev 研究 §11统一定义,本节不复制另一份设计状态或执行计划。
8.1 共同职责不等于协议等价
Section titled “8.1 共同职责不等于协议等价”可替代的是“对授权状态中的有界问题提供语义建议”这一职责。Jev 或 Laya 都不接管开放生成、关系编译、几何判断、用户接受或 CAS 提交。Aira 定义任务/候选/问题身份与失效语义,供应商边界保留真实模型输出与来源,不能把二者同名的 confidence 或 usage 强制解释成同一统计/计费尺度。
复核固定提交 4066d5d5fbf08b66c6757ddeedbd797bd7655bc0:HTTP 未知模型 ID 会自动路由,响应通用 model 名不能证明权重身份;revision/digest 支持没有默认等于应用固定版本表。serve.py、revisions.py。因此宿主绑定代码、权重、tokenizer、配置/温度、后端及预处理身份,未知或不符时拒绝把结果当固定模型证据。
8.2 编码覆盖是接入条件
Section titled “8.2 编码覆盖是接入条件”选项先限 48 tokens,预算不足仍可能裁剪问题及状态;接受 HTTP 请求不能证明决定性信息完整进入模型。common.py。不能用通用字符数或另一 tokenizer 的长度代替实际编码检查。
接线应记录实际编码覆盖及裁剪,并保留足以判定语义差异的候选内容。若无法证明必要信息被保留,缩小有明确依赖的状态切片、重新提出可判断问题或返回不可评估,不能静默删除困难候选后保持原任务成功口径。分窗聚合是另一种推理策略,必须独立限定并评价,不能伪装成完整长上下文的一次判断。
候选 ID 本身不携带隐藏语义。标签置换、正确答案缺失、相同当前形状但不同未来编辑、长无关状态及中英混合必须进入组件资格判据;模型自信不能给缺失的用户偏好补真值。
8.3 本地运行与云运行分别取得资格
Section titled “8.3 本地运行与云运行分别取得资格”本地资格要求完整固定 artifact/依赖、禁网冷启动与重开、实际业务探针、请求总 deadline、队列和取消、峰值资源,以及与 Aira 几何计算并行时的争用证据。加载器存在本地路径,也有缺文件远程回退,故仅设置一个本地目录或健康接口返回 ok 不算离线通过。agent.py。
云资格核对实际模型版本、资料外发范围、账户地区/保留承诺、服务失败与费用边界。“不训练”不等于零保留;不能从公开企业选项推断当前账户配置。TypeSafe Legal、Privacy。本地不可用不能静默切云;选择其他模型也必须符合当前授权和能力状态。
生产网关已有预留与保守结算,接线应复用并贯通每次 attempt。SDK 内部重试关闭,或证明每次尝试都受现有准入和总 deadline 控制;Jev 实际账单、Laya 资源/运维成本和 Aira 的任务总预算分别记录,不用同名 tokens 抹平差异。Node 本地路径与生产路径的保证应分别实测。
8.4 评价与采用
Section titled “8.4 评价与采用”沿 Jev §11.5 的组件→架构→模型增益顺序,只将组件资格合格的候选推进完整流程。不预设 Jev/Laya 串联,不要求为对照保留多套产品执行权威。两篇原样本设计目的不同,执行前在既有评价 issue 冻结具体 campaign,保持需求来源分组、独立留出及总预算可比。
模型收益与部署资格是不同条件:能离线加载不证明语义正确;语义准确不证明能与几何计算共存;理论成本公式不证明实际更便宜。采用首先需要受影响的正确性/恢复硬条件与实际运行资格成立。若以智能提升为目标,还须证明独立任务收益;若目标是硬离线或数据不出域,则满足该硬条件及预设质量/资源门槛或对基线非劣界也可采用,无需虚构自主成功率提升。未满足所声明目的时保留同一架构中的原判断策略和未决状态,明确报告回退。
不使用 Jev 输出或派生标签训练/蒸馏 Laya。MCA §2.3 的用途限制应按实际行为和账户协议核对;普通 Aira CAD 对照/选型不自动等于开发竞争模型,普通输入鲁棒性语料也不自动等于服务漏洞测试,不为此另建笼统审批 Gate。MCA。本轮研究不授权付费调用、本地推理、部署、模型训练或产品运行时替换。
9. 开放权重的架构价值与版本复核(2026-09-28)
Section titled “9. 开放权重的架构价值与版本复核(2026-09-28)”9.1 从判断组件到设计决策架构
Section titled “9.1 从判断组件到设计决策架构”开放权重的价值不只在部署地点。Aira 可以检查并共同调整状态表示、问题与候选编码、判别实现及其调用策略,让设计解释成为可比较、可深化、可澄清的对象。当前 Choice/Score/Noul 是首个可复用机制,不是 AI 原生核心的能力上限;学习模型的输出仍不能创造工程证明、用户接受或事务权限。
由职责划分可以推导:语义候选可以先保存保持量、修改作用域和未来编辑规则,尚未深化的解释无需立即物化几何;确定性核心可计算不同解释的实际编辑后果,协调器再根据独立需求与已有证据决定深化、扩展或澄清。判别器可以辅助该调度。候选集合未包含正确解释时,必须保留扩展或不可判定结果;高分不能证明候选集合完备,低分不能证明几何无解。整体是否更快还取决于判别、编码、错误选择、补救及人工交互成本,不能只统计少生成了多少 token 或形体。
首个机制应覆盖三个不同决策族:相同当前形状下的保持量与未来编辑规则;共享定义与单个实例的修改作用域;缺失约束、歧义或正确候选缺失时的澄清与扩展。几何反事实只证明编辑后果,意图标签必须来自独立需求和审查,不能把 geometry pass 当作用户意图真值。分别观察候选覆盖、正确候选存在时的判别、错误强选、澄清负担及总任务成本,才能定位收益和共同失败原因。
开放代码与权重提供 CAD 专用编码、决策头、校准和领域微调的研究空间。先测固定预训练基线并识别共同错误;只有错误可归因于学习责任且有合法、独立标注时,才论证适配。探索数据、训练数据与独立留出按需求来源分组,几何验证不能自动产生偏好标签,也不使用 Jev 输出或派生标签蒸馏 Laya。能读取权重不等于可以完整复现基础训练,更不等于已经具备 CAD 专长。
这是架构机会与责任推导;具体优先级、实验协议和状态只见 #335、#355 及既有 #364–#368,不增设另一套实施清单。
9.2 当前固定上游与旧结论的适用范围
Section titled “9.2 当前固定上游与旧结论的适用范围”本次只读取源码、模型元数据与小型配置文件。GitHub 固定于 9d955671415fc19f069b9cc998928075c1f255ec,包版本 0.3.21;HF 仍为 55cf4c4ebb4ebe31b2550e8bdf3bd21b99753851。源码 LICENSE 与权重模型卡分别标注 Apache-2.0。公开 ungated 文件列表列有 multilingual 权重 643,835,514 bytes、SHA-256 9d628fd971b700382ac6f65920a86f149777b2e748e0c955fb3b19695aa8f204;这是远端声明,未下载核验文件或实际加载身份。分发仍沿用 §4.1 的来源与通知责任。
| 复核点 | 源码事实与研究修正 |
|---|---|
| 默认窗口与可选窗口 | multilingual 配置默认仍是 max_len=1024、head_max_len=256。旧固定版本的 README 已说明显式 multilingual 可设 max_len=8192,不能把 1024 当永久模型上限。0.3.21 的 Router 和 HTTP 路径传递显式 max_len/head_max_len;扩大窗口后的实际语义覆盖、质量和成本仍待测。 |
| 选项裁剪与诊断 | 当前 common.py 仍先将每个选项限制在 48 tokens;增大 head 窗口不自动解除这个限制。新增 options_distinct/collapsed_options 有助于识别裁剪后候选合并,但不证明所有决定性 state 内容被保留,也不证明语义区别仍可见。 |
| 权重固定 | resolve_revision 现在可读取 LAYA_REVISION,显式参数优先,加载器调用该解析;旧 §3.2 的环境变量未接线结论只描述旧版本。摘要核验仍需显式配置,通用响应 model 字符串仍不足以证明实际权重身份。 |
| 本地与服务成本 | 固定版本仍需核验实际禁网冷启动、队列等待、取消和完整请求时限。Server-Timing 的模型时间不等于包含队列的总任务延迟;权重大小也不等于峰值内存。没有执行这些运行检查,不能宣布离线或性能通过。 |
一手源码:旧 README 的窗口说明、新 Router、服务参数、编码、版本解析、加载与响应。公开性能与准确率数字仍是上游报告,不是 Aira 实测。