实时文本转语音
流式生成自然语音,并通过内联指令调整语气、速度、音量、表达风格和停顿。
Inworld AI
构建自然、低延迟的实时语音交互面向实时对话应用提供完整的语音与模型基础设施,包括可控制的文本转语音、双向流式语音对话、实时语音转写和跨供应商大模型路由。开发者可通过 API 集成声音设计、语音克隆、上下文管理、工具调用、分析与故障转移能力。
从语音生成和识别到端到端对话与模型调度,为互动媒体、教育、健康及智能助手等应用提供统一的开发能力。
流式生成自然语音,并通过内联指令调整语气、速度、音量、表达风格和停顿。
可用 15 秒音频创建自定义声音,也能通过自然语言描述口音、年龄、语气和能量来设计声音。
通过 WebSocket 或 WebRTC 实现全双工音频流,支持智能轮次判断、动态上下文管理和会话内工具调用。
支持实时流式音频和文件转写,并提供语音活动检测、自定义词汇、逐词时间戳和说话人区分。
通过统一 API 在 OpenAI、Anthropic、Google 等供应商的模型之间调度,支持故障转移、A/B 测试和动态模型选择。
采用零信任框架和持续监控,并公开提供 SOC 2 Type II、HIPAA 与 GDPR 相关合规信息。
了解实时语音模型与开发成本方面的最新公开变化。
新版本支持更细致的语音方向控制、跨语言声音能力和实时流式输出,Mini 模型首个音频块延迟低于 130ms。
公开页面宣布对实时文本转语音、语音转写、模型路由和推理基础设施进行成本调整,多数开发者的相关价格降低一半或更多。
通过官方文档了解各项 API 的接入方式、功能范围和安全基础设施。