跳到主要内容

推理运行时

推理运行时

推理是一次带 schema 校验结果的模型调用。本页介绍这些调用内部如何执行:绑定、结构化输出、流式传输,以及记录存储在哪里。

ai 绑定

调用经由 ai 设施端口——由宿主提供的绑定,具体提供商在运行时接线。运行时从不直接与提供商对话,也从不持有提供商凭据。

结构化输出

运行时要求模型按 schema 输出,并在返回途中校验。格式错误的结果会重试或作为错误呈现——绝不会以未类型化的方式传给租户代码。

  prompt + schema
        │
        ▼
  ┌────────────────────────────┐
  │  ai facility binding       │
  │  (host provider at runtime)│
  └────────────┬───────────────┘
               │  model output
               ▼
  schema validation
        │
        ├── valid ──► typed result to caller
        │
        └── invalid ──► retry or error (never untyped)

流式传输

推理是当前调用中的设施 I/O。Guest 让出,宿主调用模型,随后同一次调用在同一 isolate 中恢复。等待期间上下文与容量槽位仍被保留,但等待时间不计为 CPU。模型 token、成本与轮次计量在会话行上。

会话存储

每次对话都持久化为一个租户自有的 conversation 聚合:其中包含顺序的 conversation_message 记录、它们背后受栅栏保护的 turn 尝试,以及由此结算的精确 turn_usage 记录。转录、状态和计量用量会一起同步和审计。

编写面是 推理 ;使用该运行时的 Agent 循环见 Agent loop。