Awesome GPT 一个精选的GPT-4o生成图片集锦,收集了OpenAI 最新多模态模型 GPT‑4o 生成的精彩案例,展示其强大的文本‑图像理解与创作能力。 Ai学习资源 2025年06月05日 92 点赞 0 评论 761 浏览
GR00T N1 GR00T N1 是英伟达推出的开源人形机器人基础模型,支持多模态输入并具备复杂任务执行能力。采用双系统架构,结合视觉-语言模型与扩散变换器,实现精准动作控制。基于大规模数据训练,适应多种机器人形态和任务场景,广泛应用于物流、制造、医疗等领域,提升自动化水平与操作效率。 AI项目与工具 2025年06月12日 62 点赞 0 评论 761 浏览
ChatDZQ爱晚亭 基于大语言模型开发,提供“智能+个性微调+向量训练”(即CVP)服务,集成AI聊天、AI创作、AI绘画、AI海报及各种AI工具。 AI服务商 2025年06月05日 10 点赞 0 评论 762 浏览
Stable Diffusion 3.5 Stable Diffusion 3.5是一套由Stability AI开发的先进AI图像生成模型,包含多个版本以适应不同需求。它具备高定制性、高效的消费级硬件运行能力和开源许可,能够生成高质量、多样化的图像,支持多种风格和肤色表现。其核心技术基于多模态学习和优化的架构,适用于艺术创作、游戏开发、广告设计等多个领域。 --- AI项目与工具 2025年06月12日 75 点赞 0 评论 765 浏览
ManusAI 全球首款通用型AI智能体,ManusAI通过自主任务执行、动态任务拆解、多模态交互和跨平台执行等能力,帮助用户高效完成复杂任务。 Ai平台模型 2025年06月05日 95 点赞 0 评论 765 浏览
豆包1.5·UI 豆包1.5·UI-TARS是字节跳动推出的一款面向图形用户界面(GUI)的智能代理模型,具备视觉理解、逻辑推理和操作执行能力。它无需预定义规则,即可实现端到端的GUI任务自动化,适用于办公、测试、客服及机器人交互等多个场景。模型基于多模态融合与端到端学习技术,支持高效的界面交互与精准的视觉定位。 AI项目与工具 2025年06月11日 31 点赞 0 评论 765 浏览
Seer Seer是一款由多家科研机构联合开发的端到端机器人操作模型,基于Transformer架构实现视觉预测与动作执行的高度协同。它能够融合多模态信息,具备强大的泛化能力和数据效率,在真实机器人任务中表现优异。Seer适用于工业自动化、服务机器人、医疗健康等多个领域,支持精准动作预测和未来状态预判,显著提升了机器人系统的智能化水平。 AI项目与工具 2025年06月12日 54 点赞 0 评论 766 浏览
VMB VMB是一个由多机构合作研发的多模态音乐生成框架,可从文本、图像和视频等多样化输入生成音乐。它通过文本桥接和音乐桥接优化跨模态对齐与可控性,显著提高了音乐生成的质量和定制化程度。VMB具有增强模态对齐、提升可控性、显式条件生成等特点,适用于电影、游戏、虚拟现实等多个领域。 AI项目与工具 2025年06月12日 84 点赞 0 评论 766 浏览
OmniAlign OmniAlign-V是由多所高校联合开发的多模态大语言模型对齐数据集,包含约20万个多模态样本,涵盖自然图像和信息图表。其核心功能包括提供高质量训练数据、提升模型的开放式问答能力、增强推理与创造力,并支持模型持续优化。数据集通过图像筛选、任务设计及后处理优化确保数据质量,适用于多模态对话系统、图像辅助问答、创意生成等多个应用场景。 AI项目与工具 2025年06月12日 99 点赞 0 评论 766 浏览