实时

Open Deep Research

Open Deep Research 是一个开源 AI 智能体,支持多语言模型和 Firecrawl 数据提取,用于执行复杂的研究任务。它提供统一 API 和 Next.js 框架,具备实时数据处理、结构化信息提取及多维度分析能力,适用于文献综述、行业分析、投资研究等场景。

Vozard

一款由iMobie开发的AI驱动的实时语音变声软件,提供超过100种逼真的语音效果。用户可以在在线聊天、游戏等场景中使用。

Pika Twists

Pika Twists 是 Pika Labs 推出的 AI 视频编辑工具,支持用户精准操控视频中的主体动作和场景,实现创意效果。通过简单描述即可完成角色或物体的动作修改,同时保持画面自然。功能包括主体操控、元素调整、风格化处理、逼真渲染等,适用于短视频、广告、教学等多种场景,提高视频创作效率和表现力。

Huru

Huru是一款基于AI技术的面试准备工具,通过模拟真实面试场景,提供即时反馈与个性化建议,覆盖多语言及多行业职位需求,帮助用户有效提升面试技能。支持Web、iOS和Android设备,适用于求职者、职业培训机构及招聘公司,助力求职者获取理想工作。

LivePortrait

利用AI技术将静态照片转换为视频,展现逼真的面部表情和动作。

Open Avatar Chat

Open Avatar Chat是阿里开源的模块化实时数字人对话系统,支持低延迟交互与多模态输入输出。系统采用模块化架构,允许灵活配置语音识别、语言模型和语音合成等组件,兼容本地与云服务。支持2D/3D数字人渲染,适用于客户服务、教育、娱乐及企业应用等多个场景,为开发者提供高效、灵活的AI对话解决方案。

CosyVoice

一种深度融合文本理解和语音生成的一项新型语音合成技术,CosyVoice能够精准解析并诠释各类文本内容,将其转化为宛如真人般的自然语音。

Loora

Loora是一款AI驱动的英语口语学习工具,通过模拟真实场景帮助用户提升英语表达能力。支持商务、面试、日常交流等多场景练习,提供实时发音、语法及流利度反馈。具备24小时可用性、个性化课程设计、语音识别与翻译功能,并支持学习进度跟踪,适用于各类英语学习者。

Parakeet TDT 0.6B

Parakeet TDT 0.6B 是一款由英伟达开发的开源自动语音识别(ASR)模型,采用 FastConformer 和 TDT 架构,具备高速转录、高精度识别、歌词转录、文本格式化等功能。模型在 Hugging Face Open ASR Leaderboard 中表现优异,实时因子高达 3386,适用于会议记录、法律医疗、字幕生成及音乐索引等多种场景。