跳转到内容

Aira 生产运行条件

发布方案与待校准预算,尚未授权执行。部署准入见上线计划,操作命令见provider-off Runbook。 平台价格、地区政策和版本为原调查快照,本次仅整理文档,未重新联网核价;实际采用前复核末尾官方依据。

flowchart LR
U[用户浏览器] -->|HTML / JS / WASM| S[Cloudflare Static Assets]
U -->|IndexedDB| L[本地项目与证据]
U -->|导出 / 导入| F[.aira.json 备份]
U -->|同源 /api/step| W[Cloudflare Worker 网关]
W -->|受控模型请求| P[模型服务商]
W --> O[日志、指标、费用熔断]

此架构的关键点:

  1. 静态资源由 CDN 分发,避免让 VPS 承担约 60 MiB 的 WASM 下载;
  2. CAD 几何计算在浏览器执行,服务端不需要高 CPU/GPU;
  3. Worker 只保存密钥、校验请求、实施配额并代理模型请求;
  4. /api/step 与前端同域,减少 CORS、Cookie 和网络配置复杂度;
  5. 项目数据默认不上云,AI 请求所包含的意图和模型上下文仍需在隐私说明中明确披露。
flowchart LR
C[大陆用户浏览器] -->|备案域名| D[阿里云 OSS 或腾讯云 COS]
D --> N[境内 CDN]
C -->|/api/step| A[受控 API 服务]
A --> M[目标地区可用的模型服务]

大陆轨必须在上线前单独关闭以下事项:

  • 完成域名实名认证、ICP 备案及适用的公安备案/业务合规检查;
  • 静态桶禁止目录列举和任意写入,只允许 CI 发布账号写入;
  • 选择在目标地区具备可用性和合规条件的模型服务,禁止依赖绕过地区限制的方案;
  • 在中国大陆运营前,由负责人确认隐私政策、用户协议、数据跨境和生成式 AI 相关义务;
  • 在中国移动、联通、电信网络做真实首屏、WASM 下载、缓存命中和 API 延迟测试。

AIRA_OPENAI_ENDPOINT 允许配置 HTTPS Responses 端点,但这只解决技术接入,不自动证明第三方服务与当前协议完全兼容,也不替代地区与法律审核。

方案 适用阶段 固定成本起点 结论
Cloudflare Static Assets 海外静态预览 免费,域名另计 已选方案;静态请求免费且不限量
Cloudflare Workers Paid 邀请制 AI Alpha 约 US$5/月,模型费另计 默认生产方案;先取得更稳定的 CPU 配额和用量指标
Vercel Pro 团队偏好 Vercel 工作流时 US$20/成员/月,模型费另计 技术可行,但对当前静态+轻网关架构通常不如 Cloudflare 省钱
2 vCPU / 4 GB VPS Worker 不兼容或需常驻进程时 示例约 US$24/月,另含运维时间 暂不购买;只作回退
阿里云 OSS / 腾讯云 COS + CDN 中国大陆正式入口 按区域、存储和流量计费 大陆用户为主时采用,先完成备案

Vercel Hobby 计划只适用于非商业、个人用途;正式商业 Alpha 应按 Pro 预算。Vercel 在香港、日本、新加坡有区域,但没有中国大陆区域。它可用于海外发布,却不能因此推导出大陆访问稳定。

模型费用与静态托管费用分开管理。对 Aira 而言,最可能失控的是模型调用,不是静态带宽。Alpha 期建议先批准以下提议值,负责人可在环境配置中下调:

  • 单次网关请求体:最多 1 MB(保持现有实现);
  • 单用户并发 AI 任务:2;
  • 单用户:10 次 gateway turn/分钟;单 IP:30 次/分钟;
  • 单个 provider turn:邀请制生产暂以 4,096 输出 token 作为费用与失控保护;这是尚待实测校准的运行策略, 不是 Aira 能力上限,也不得用于复杂建模评测;
  • 单任务:Alpha 部署目标最多 24 turns、3 分钟、估算 US$1.50;当前诊断采样使用更宽的技术安全上限, 其数据用于确定最终区间,不能直接复制为生产配置;
  • 全应用:US$10/日软告警、US$100/月硬上限;达到硬上限立即关闭真实 provider;
  • 模型 allowlist:Alpha 只允许一个已评测模型,切换模型视为受控发布。

月度硬上限必须同时在 Aira 网关和模型服务商控制台设置;客户端预算只能作为体验与安全辅助,不能作为账单的唯一控制。

  1. 在干净 release commit 上运行既有 pnpm check,并完成当前候选的实际产品验证;
  2. 构建 Web artifact 和 Worker bundle,并记录待部署字节的 SHA-256;
  3. 部署到唯一预览 URL,不重新构建;
  4. 自动执行首页、WASM、API health 和核心操作冒烟;
  5. 发布负责人核对候选验证结果、费用上限、provider allowlist 和 kill switch;
  6. 将同一 artifact 晋级到生产,自定义域名切流;
  7. 观察 30 分钟,仅在发布准入满足且已获授权后开放访问。

不得上传无法追溯的 dist,也禁止在 VPS 上临时 git pull && build。

出现任一条件立即停止邀请并回滚:

  • 项目数据损坏、错误提交或导出文件不可恢复;
  • API key/用户凭据泄漏迹象;
  • 费用速率超过预算或无法计量;
  • 新版本核心 WASM 无法加载;
  • AI 绕过 preview/validate/commit 安全顺序;
  • 5xx 或关键操作失败率持续越过告警阈值。
  1. 先触发服务端 kill switch,使真实 provider 停止;
  2. 将静态资源和 Worker 同时回滚到上一个 manifest 版本;
  3. 保留故障版本日志和候选信息,记录开始时间、影响用户和 request ID;
  4. 执行上一版本冒烟测试,确认 IndexedDB 项目仍可读取和导出;
  5. 对受影响用户发出说明,完成复盘后再恢复邀请。

首发仪表盘至少包括:

  • 静态:index.html 成功率、各 WASM 下载失败率、首访/缓存命中加载时间;
  • API:请求量、401/403/429/5xx、p50/p95 延迟、上游超时;
  • AI:每任务 turns、input/output token、估算费用、模型错误、取消和预算拒绝;
  • 产品:创建项目、核心操作、导出、导入、刷新恢复成功率;
  • 安全:限流拒绝、异常 IP、kill switch 状态和 secret 轮换时间。

AI 一行的问题事件 agent.problem 与五种失败判定见 RFC-0015;阈值只在本文维护。

Alpha 初始 SLO:

  • 不允许出现未计量、无上限的 provider 调用;
  • P0 数据损坏为 0;
  • 静态入口月度可用性目标 99.9%,AI 网关月度目标 99.0%;
  • 5xx 连续 5 分钟超过 2% 告警;支出加预留达到日预算 80% 告警,实际结算支出达到 100% 自动关闭 provider;
  • 告警必须到达明确的人,而不是只写日志。

只有以下证据出现时才采购 VPS:

  • Worker 无法兼容所需 Node/provider SDK,且改成标准 fetch adapter 的代价不合理;
  • 需要超过 Worker 请求时长的常驻任务、队列或流式连接;
  • 目标模型/合规地区要求固定出口 IP 或指定区域;
  • 已有真实负载证明 Worker 成本高于 VPS,而不是凭感觉提前运维服务器。

若触发,网关起步配置为 2 vCPU / 4 GB RAM / 50–80 GB SSD。静态资源仍放 CDN,VPS 只运行 API 网关。推荐 Ubuntu 24.04 LTS、Caddy、systemd 和云防火墙;仅开放 80/443,SSH 只用密钥并限制来源。必须补齐自动安全更新、日志轮转、磁盘/内存告警、每日配置备份、密钥轮换和每月恢复演练。

自维护复杂度属于中等:应用本身轻,但操作系统补丁、证书、防火墙、备份、监控和故障响应会持续占用人力。没有专门运维负责人时,不应把它作为首发默认方案。

外部价格、限制和地区政策会变化;每次从 L0 晋级或更换平台前,发布负责人必须重新核对官方页面,不应只依赖本文快照。