Inworld AI

Inworld AI

构建自然、低延迟的实时语音交互面向实时对话应用提供完整的语音与模型基础设施,包括可控制的文本转语音、双向流式语音对话、实时语音转写和跨供应商大模型路由。开发者可通过 API 集成声音设计、语音克隆、上下文管理、工具调用、分析与故障转移能力。

Inworld AI 页面快照
<130ms
Realtime TTS-2 Mini 首个音频块延迟
15 秒
创建自定义克隆声音所需的音频长度
100+
文本转语音覆盖的语言数量
220+
Realtime Router 可连接的模型数量
核心能力

覆盖实时语音交互的完整技术栈

从语音生成和识别到端到端对话与模型调度,为互动媒体、教育、健康及智能助手等应用提供统一的开发能力。

实时文本转语音

流式生成自然语音,并通过内联指令调整语气、速度、音量、表达风格和停顿。

语音克隆与声音设计

可用 15 秒音频创建自定义声音,也能通过自然语言描述口音、年龄、语气和能量来设计声音。

端到端实时语音 API

通过 WebSocket 或 WebRTC 实现全双工音频流,支持智能轮次判断、动态上下文管理和会话内工具调用。

实时语音转写

支持实时流式音频和文件转写,并提供语音活动检测、自定义词汇、逐词时间戳和说话人区分。

多模型智能路由

通过统一 API 在 OpenAI、Anthropic、Google 等供应商的模型之间调度,支持故障转移、A/B 测试和动态模型选择。

安全与合规基础设施

采用零信任框架和持续监控,并公开提供 SOC 2 Type II、HIPAA 与 GDPR 相关合规信息。

产品动态

近期公开产品进展

了解实时语音模型与开发成本方面的最新公开变化。

Realtime TTS-2 已上线

新版本支持更细致的语音方向控制、跨语言声音能力和实时流式输出,Mini 模型首个音频块延迟低于 130ms。

面向开发者下调产品成本

公开页面宣布对实时文本转语音、语音转写、模型路由和推理基础设施进行成本调整,多数开发者的相关价格降低一半或更多。

开发资源

文档、安全与产品资料

通过官方文档了解各项 API 的接入方式、功能范围和安全基础设施。

Inworld AI

从这里开始使用Inworld AI。