低延迟 - 智狐AI导航

TEN VAD

TEN VAD是一款高性能的实时语音活动检测系统，专为企业级应用设计。它基于深度学习技术，能够精确区分语音和非语音信号，具有低延迟、轻量级和高精度的特点。支持多种平台和编程接口，适用于智能助手、客服机器人等场景，帮助构建更高效、更智能的对话系统。

AI项目与工具 2025年06月11日 47 点赞 0 评论 686 浏览

Hibiki

Hibiki是一款由Kyutai Labs开发的开源语音翻译解码器，支持实时语音到语音（S2ST）和语音到文本（S2TT）的翻译。其基于多流语言模型架构，结合弱监督学习和上下文对齐技术，实现低延迟、高保真度的翻译效果。适用于国际会议、在线教育、旅游、新闻采访及客户服务等场景，具备良好的实用性和可扩展性。

AI项目与工具 2025年06月12日 31 点赞 0 评论 693 浏览

ElevenLabs Flash

ElevenLabs Flash是一款专为对话型AI设计的低延迟语音合成模型，支持多种语言，能够以极短的延迟（75毫秒）生成高质量语音，广泛应用于虚拟助手、客户服务、语音播报、教育及娱乐等领域，为用户提供即时反馈和沉浸式体验。该工具以其高效性和灵活性成为超低延迟语音合成领域的领先解决方案。

AI项目与工具 2025年06月12日 68 点赞 0 评论 718 浏览

Eleven Labs

Eleven Labs的长格式语音生成平台使用人工智能为创作者和出版商创造自然而引人注目的声音。

Ai语音工具 2026年06月23日 0 点赞 0 评论 749 浏览

Orpheus TTS

Orpheus TTS 是一款基于 Llama-3b 架构的开源文本到语音系统，支持自然、富有情感的语音生成。具备零样本语音克隆能力，无需预训练即可模仿特定语音，延迟低至 200 毫秒，适合实时应用。支持多种语音风格和情感控制，适用于有声读物、虚拟助手、游戏、教育等多个领域。

AI项目与工具 2025年06月12日 26 点赞 0 评论 759 浏览

Realtime API

Realtime API是一款由OpenAI研发的低延迟、多模态对话式API，支持文本与音频输入输出，具备实时语音处理、自然语音合成及多模态交互等功能。通过WebSocket协议实现持久连接，支持事件驱动的交互模式，适用于客户服务、语言学习、游戏娱乐等多种应用场景。

AI项目与工具 2025年06月12日 41 点赞 0 评论 761 浏览

Mureka O1

Mureka O1是昆仑万维推出的全球首款音乐推理大模型，采用“思维链”技术提升音乐生成质量与创作效率。支持多语言AI音乐创作，涵盖多种风格与情感表达，具备歌词生成、风格控制、音色克隆等功能。提供API接口与模型微调能力，适用于广告、影视、游戏、教育等多个场景，助力创作者高效完成音乐创作任务。

AI项目与工具 2025年06月12日 39 点赞 0 评论 772 浏览

Unmute

Unmute 是 Kyutai 推出的低延迟语音交互系统，专注于语音转文字和文字转语音功能。基于先进 AI 模型，提供实时、高效的语音交互体验，支持用户与 AI 进行语音交流，并能将文字内容快速转换为自然流畅的语音输出。其低延迟处理能力实现无缝交互，具备快速集成、随时打断、10秒生成声音、多样化调整等功能，适用于在线教育、智能客服、语音助手、游戏娱乐和企业会议等场景。

AI项目与工具 2025年06月11日 58 点赞 0 评论 791 浏览

Mistral Small 3

Mistral Small 3 是一款由 Mistral AI 推出的开源大语言模型，具备 240 亿参数，支持多语言处理，适用于低延迟场景。模型基于 Transformer 架构，支持长文本输入，具备高性能和本地部署能力。其可定制性强，适用于虚拟助手、客服系统、自动化任务及专业领域应用，如医疗和法律咨询。

AI项目与工具 2025年06月12日 77 点赞 0 评论 791 浏览

DeepEP

DeepEP 是 DeepSeek 开发的开源 EP 通信库，专为混合专家模型（MoE）的训练和推理设计。它提供高吞吐、低延迟的 GPU 内核，支持 NVLink 和 RDMA 通信，优化了组限制门控算法，兼容 FP8 等低精度数据格式。适用于大规模模型训练、推理解码及高性能计算场景，具有良好的系统兼容性和网络优化能力。

AI项目与工具 2025年06月12日 43 点赞 0 评论 816 浏览

低延迟

首页

低延迟

列表

默认

浏览次数

发布日期