Indic Parler Indic Parler-TTS 是一款由 Hugging Face 与 AI4Bharat 联合开发的多语言文本到语音模型,支持 20 种印度语言和英语,提供 69 种独特语音。该模型基于深度学习架构,通过描述性文本输入实现对音调、语速、情感等参数的灵活控制,适用于多种语音合成场景。在低资源语言上表现优异,具备高自然度和清晰度的语音输出能力。 AI项目与工具 2025年06月12日 55 点赞 0 评论 168 浏览
ListenHub ListenHub 是一款基于 AI 技术的播客生成工具,支持中英文内容处理,可快速生成高质量播客。它能自动生成主题、脚本,并提供超真实人声体验。用户可自定义角色、编辑音频并一键发布至多个平台,适用于个人创作、知识分享和娱乐休闲等多种场景。 AI项目与工具 2025年06月11日 57 点赞 0 评论 168 浏览
MonkeyOCR MonkeyOCR是由华中科技大学与金山办公联合开发的文档解析模型,能够高效地将非结构化文档内容转换为结构化信息。其支持多种文档类型和语言,处理复杂文档(如公式、表格)效果显著,处理速度达每秒0.84页。基于SRR三元组范式和MonkeyDoc数据集,模型在准确性和效率上表现优异,适用于自动化业务流程、数字存档、智能教育、医疗记录管理及学术研究等场景。 AI项目与工具 2025年06月11日 15 点赞 0 评论 167 浏览
PictureThis PictureThis是一款基于AI技术的植物识别应用,支持超过17000种植物的精准识别,具备疾病诊断、个性化护理建议、毒性警告等功能。用户可通过拍照快速获取植物信息,提升园艺管理效率。应用支持多语言,适合全球用户使用,同时提供社区互动和离线功能,方便日常使用。 AI项目与工具 2025年06月12日 82 点赞 0 评论 166 浏览
万兴天幕多媒体大模型 一个涵盖了视觉、音频、语言等多模态AI生成和优化能力的多媒体大模型,万兴天幕多媒体大模型核心功能包括一键成片、AI美术设计、文生音乐、音频增强、音效分析、多语言对话等。 Ai平台模型 2025年06月05日 40 点赞 0 评论 166 浏览
Tarsier2 Tarsier2是字节跳动研发的大规模视觉语言模型,擅长生成高精度视频描述并在多项视频理解任务中表现优异。其核心技术包括大规模数据预训练、细粒度时间对齐微调以及直接偏好优化(DPO)。该模型在视频问答、定位、幻觉检测及具身问答等任务中均取得领先成绩,支持多语言处理,具有广泛的应用潜力。 AI项目与工具 2025年06月12日 59 点赞 0 评论 164 浏览
Nova Sonic Nova Sonic是亚马逊推出的生成式AI语音模型,集成语音理解和生成功能,支持多种语言和口音,具备高准确性与自然对话能力。其采用HiFi语音识别技术,平均单词错误率低至4.2%,支持实时信息获取与请求路由,适用于客户服务、教育、医疗、旅游及娱乐等多个领域。该模型具备低延迟和高性价比优势,是当前市场上较为突出的语音处理工具。 AI项目与工具 2025年06月12日 61 点赞 0 评论 163 浏览
Heeyo Heeyo是一款面向3至11岁儿童的智能AI学习伙伴,提供超过2000种互动学习游戏,涵盖阅读、科学、智力问答等领域。这款AI学习伙伴支持20种语言,由顶尖教育机构训练,确保安全和有趣的学习体验。Heeyo能够根据孩子的年龄和兴趣个性化推荐学习内容,孩子们还可以设计自己的AI伙伴,享受定制化的学习体验。Heeyo承诺100%无广告,严格遵守COPPA儿童隐私保护法,让家长能够监控孩子的学习进度。 AI项目与工具 2025年06月12日 82 点赞 0 评论 163 浏览
JoyGen JoyGen是由京东科技与香港大学联合开发的音频驱动型3D说话人脸视频生成框架,能够实现唇部动作与音频信号的精准同步,并提供高质量的视觉效果。该工具采用单步UNet架构进行高效视频编辑,基于130小时中文视频数据集训练,在唇音同步和视觉质量方面表现优异。适用于虚拟主播、动画制作、在线教育及多语言视频生成等多个领域,为视频内容创作提供了创新解决方案。 AI项目与工具 2025年06月12日 78 点赞 0 评论 163 浏览
Hyring Hyring 是一款基于 AI 的招聘工具,支持视频面试、动态问题生成、多语言交流及 AI 抄袭检测,提升招聘效率与公平性。提供数据驱动的评估报告、灵活面试设置及候选人管理功能,适用于各类企业与全球招聘场景,助力高效人才筛选。 AI项目与工具 2025年06月11日 15 点赞 0 评论 163 浏览