VideoAgent VideoAgent是一款基于自改进机制的视频生成系统,结合图像观察与语言指令生成机器人控制视频计划。它采用自我条件一致性方法优化视频质量,通过预训练视觉-语言模型反馈和实际执行数据的收集,持续提升生成效果,减少幻觉内容并提高任务成功率。VideoAgent在模拟环境中有优异表现,并已应用于机器人控制、模拟训练、教育研究、游戏开发以及电影制作等领域,展现出广泛的应用潜力。 AI项目与工具 2025年06月12日 66 点赞 0 评论 700 浏览
爱扒谱 爱扒谱是一款基于人工智能技术的在线音乐处理平台,提供一键扒谱、音轨分离、AI音乐生成及MP3转MIDI等功能。它适用于音乐创作者、教师、学生及爱好者,能够显著提升音乐创作效率和学习体验。其主要特点包括高效便捷、智能精准、多平台支持及用户友好性。 AI项目与工具 2025年06月12日 53 点赞 0 评论 700 浏览
Google AI Edge Gallery Google AI Edge Gallery 是谷歌推出的实验性应用,支持在 Android 设备上本地运行机器学习和生成式人工智能模型,无需联网。用户可切换不同模型,进行图像问答、文本生成、多轮对话等操作,并实时查看性能指标。应用支持自带模型测试,提供丰富的开发者资源,助力探索设备端 AI 的强大功能。 AI项目与工具 2025年06月11日 75 点赞 0 评论 700 浏览
OpenEMMA OpenEMMA是一个开源的端到端自动驾驶多模态模型框架,基于预训练的多模态大型语言模型(MLLMs),能够处理视觉数据和复杂驾驶场景的推理任务。它通过链式思维推理机制提升轨迹规划和感知任务性能,并集成了优化的YOLO模型以提高3D边界框预测的准确性。此外,OpenEMMA支持人类可读的输出,适用于多种驾驶环境,包括城市道路、高速公路、夜间及复杂天气条件下的驾驶。 AI项目与工具 2025年06月12日 36 点赞 0 评论 700 浏览
MetaStone MetaStone-L1-7B 是一款轻量级推理模型,具备强大的数学和代码推理能力,性能达到行业领先水平。基于 DeepSeek-R1-Distill-Qwen-7B 架构,采用 GRPO 训练方式,支持多种计算架构并具备高效的云原生部署能力。适用于数学解题、编程辅助、智能客服、内容创作等多个场景,具有广泛的应用价值。 AI项目与工具 2025年06月12日 43 点赞 0 评论 701 浏览
SimplifyAI SimplifyAI 是一款支持多格式文档翻译的 AI 工具,可保持原文排版并提供术语管理、实时翻译及语言优化功能。适用于学术研究、商业文件处理、跨境电商、教育和个人学习等多种场景,确保翻译准确、高效且安全。 AI项目与工具 2025年06月12日 35 点赞 0 评论 701 浏览
Kimi翻译通 Kimi翻译通是一款专注于中英文互译的智能翻译工具,支持直译与意译,具备高精度翻译能力,尤其擅长处理专业学术论文及长篇文档。它兼容多种文件格式,提供分段翻译功能,适用于学术研究、商务交流、法律文件翻译等多个领域,帮助用户突破语言障碍,提升跨语言工作效率。 AI项目与工具 2025年06月12日 69 点赞 0 评论 701 浏览
笔启AI 笔启AI是一款面向学术写作的智能辅助工具,支持快速生成论文大纲与正文,具备智能查重、降重、文献推荐等功能。平台提供多语言支持,涵盖中、英、日等多种语言,适用于不同学科需求。用户可通过上传资料定制内容,提升论文原创性与专业性,同时支持数据图表插入与格式导出,助力高效完成高质量学术论文。 AI项目与工具 2025年06月11日 70 点赞 0 评论 701 浏览
Moshi Moshi是一款由法国Kyutai实验室开发的端到端实时音频多模态AI模型,具备听、说、看的能力,并能模拟70种不同的情绪和风格进行交流。Moshi具有多模态交互、情绪和风格表达、实时响应低延迟、语音理解与生成、文本和音频混合预训练以及本地设备运行等特点。它支持英语和法语,主要应用于虚拟助手、客户服务、语言学习、内容创作、辅助残障人士、研究和开发、娱乐和游戏等领域。 AI项目与工具 2025年06月12日 73 点赞 0 评论 701 浏览
Mage Mage是一款利用先进AI技术将文本转换为高质量数字艺术作品的创意平台。它支持多种艺术风格和自定义参数,操作简便高效,适用于插画、设计及内容创作等多个领域。平台具备用户友好的界面设计,提供免费基础服务,鼓励社区互动与灵感交流。 AI项目与工具 2025年06月12日 52 点赞 0 评论 701 浏览