FunAudioLLM FunAudioLLM是由阿里巴巴通义实验室开发的开源语音大模型项目,包含SenseVoice和CosyVoice两个子模型。SenseVoice擅长多语言语音识别和情感辨识,支持超过50种语言;CosyVoice则专注于自然语音生成,支持多种语言、音色和情感控制。该项目适用于多语言翻译、情感语音对话等场景,其相关模型和代码已公开发布。 AI项目与工具 2025年06月12日 66 点赞 0 评论 562 浏览
Casibase 一个开源的AI知识库和对话系统,支持多种主流 AI 模型,具备企业级功能和多语言界面,适合企业知识管理和智能对话场景。 Ai平台模型 2025年06月05日 41 点赞 0 评论 562 浏览
Make Make-A-Character(简称Mach)是由阿里巴巴集团智能计算研究院开发的3D数字人生成框架,通过文本描述快速生成逼真的3D角色。该系统支持灵活的定制化、高度逼真的渲染、完整的角色模型及动画支持。其工作流程包括文本解析、视觉提示生成、参考肖像图像生成、密集面部坐标检测、几何生成、纹理生成、纹理修正、头发生成、资产匹配和角色装配。Mach生成的角色模型可以无缝集成到游戏和电影行业的标准CG AI项目与工具 2024年01月01日 39 点赞 0 评论 562 浏览
Huru Huru是一款基于AI技术的面试准备工具,通过模拟真实面试场景,提供即时反馈与个性化建议,覆盖多语言及多行业职位需求,帮助用户有效提升面试技能。支持Web、iOS和Android设备,适用于求职者、职业培训机构及招聘公司,助力求职者获取理想工作。 AI项目与工具 2025年06月12日 23 点赞 0 评论 562 浏览
Umi Umi-OCR 是一款离线 OCR 工具,支持图片、截图和 PDF 文档的文字识别,具备数学公式与二维码识别功能,可生成可搜索 PDF。支持多语言识别与界面切换,提供命令行和 HTTP 接口调用,适用于文档数字化、数据录入、教育等多个场景。 AI项目与工具 2025年06月12日 51 点赞 0 评论 562 浏览
VideoCaptioner VideoCaptioner是一款基于大语言模型的智能字幕处理工具,支持语音识别、字幕优化、翻译、样式调整及视频合成等功能。无需GPU即可运行,兼容多语言和多种字幕格式,适用于视频创作者、教育工作者及字幕翻译团队,提升字幕制作效率与质量。 AI项目与工具 2025年06月12日 50 点赞 0 评论 561 浏览
QuillWord QuillWord 是一款专为学术和研究写作设计的AI工具,提供智能文本生成、语法检查、风格优化、大纲与摘要生成、邮件撰写及多种引用格式支持。具备文档编辑、多语言处理、云存储和协作功能,适用于论文撰写、研究报告、期刊投稿等场景,提升写作效率与专业性。 AI项目与工具 2025年06月12日 28 点赞 0 评论 561 浏览
SurveyGO卷姬 SurveyGO是一款由清华大学与面壁智能团队联合开发的开源AI论文写作工具,支持根据用户输入的主题快速生成结构清晰、内容详实的综述文章。其核心技术LLMxMapReduce-V2利用文本卷积算法整合多篇文献,提升信息完整性与逻辑性。支持中英文双语输出,适用于科研、教学、行业分析等多种场景,显著提升文献综述的写作效率与质量。 AI项目与工具 2025年06月11日 39 点赞 0 评论 561 浏览