语音

Cockatoo

一款由AI驱动的语音转文字服务,能够在几秒钟内将音频或视频文件转换为文字或字幕。

MARS5

MARS5-TTS是一款开源的AI声音克隆工具,支持140多种语言的文本转语音功能。它能够生成高度逼真的语音,并处理复杂的韵律场景。该工具拥有12亿参数,基于超过15万小时的训练数据。用户可以通过文本中的标点符号和大小写等标记引导语音的韵律和情感,同时提供快速克隆和深度克隆两种模式。MARS5-TTS可应用于内容创作、语言学习、辅助技术、客户服务和多媒体娱乐等多种场景。

盘盘单词

盘盘单词是一款由百度网盘推出的AI英语学习微信小程序,它运用生成式AI技术分析用户照片,提取关键元素并生成相关英语单词和例句,帮助用户加深记忆。该程序提供了个性化学习路径、名人语音智能体和智能复习计划等功能,用户的学习资料存储在云端,不占用手机内存。盘盘单词适用于希望提高英语水平的各类用户,包括学生、职场人士、语言爱好者及备考人员。

Spark

Spark-TTS是一款基于大型语言模型的高效文本转语音工具,支持中英文双语及跨语言合成。它无需额外生成模型,通过LLM预测编码直接生成音频,实现零样本语音克隆。用户可自定义语音参数,如音色、语速等,适用于语音助手、多语言内容创作、智能客服及虚拟角色配音等多种场景。

Pemo

Pemo是一款AI驱动的文档管理工具,支持多格式文档导入与管理,提供智能翻译、摘要生成、思维导图、格式转换及语音朗读等功能。用户可自定义阅读模式并进行标注与笔记,提升阅读效率与知识整理能力,适用于学习、科研、办公及日常阅读等多种场景。

音剪

专业音频制作,激发创新灵感,释放创意潜力,让你的音频创作更自由、便捷和精彩

VideoGen

一款能够在几秒钟内生成高质量、无版权的AI视频生成器。具有逼真AI声音的语音合成引擎、优化的视频编辑器和数百万商用免版税素材,为个人、企业和团队提供了一个快速、简单的视频制作体验。

PaddleSpeech

PaddleSpeech是百度飞桨团队开发的开源语音处理工具,涵盖语音识别、语音合成、声纹识别、语音翻译等功能。支持多种接口形式,适用于智能语音助手、语音播报、身份验证等场景。基于PaddlePaddle框架,提供高效的深度学习模型和丰富的音频处理能力,适用于多种实际应用需求。

Arctime

简单、强大、高效的跨平台字幕制作软件

PDF to Podcast

PDF to Podcast 是一款由 NVIDIA 开发的 AI 工具,能够将 PDF 文档自动转换为高质量的音频内容,如播客。该工具结合了大型语言模型、文本到语音技术以及 NVIDIA NIM 微服务架构,支持从 PDF 提取信息并生成结构化文本,再通过语音合成输出自然流畅的音频。用户可自定义生成内容的重点,并支持多种部署方式,适用于企业培训、技术简报、客户服务、医疗教育等多个领域。