Wonder Journey 只需输入一段文字描述或上传一张图片,WonderJourney就能从任意指定的地点开始,生成一连串既多样化又连贯的3D场景。 3D&游戏 2025年06月05日 70 点赞 0 评论 875 浏览
VRAG VRAG-RL是阿里巴巴通义大模型团队推出的视觉感知驱动的多模态RAG推理框架,旨在提升视觉语言模型在处理视觉丰富信息时的检索、推理和理解能力。通过定义视觉感知动作空间,实现从粗粒度到细粒度的信息获取,并结合强化学习和综合奖励机制优化模型性能。该框架支持多轮交互推理,具备良好的可扩展性,适用于智能文档问答、视觉信息检索、多模态内容生成等多种场景。 AI项目与工具 2025年06月11日 84 点赞 0 评论 873 浏览
Caveduck 一个AI角色扮演聊天服务,支持中、英、日韩等多语言,提供多种LLM选择,RWD支援良好,任何设备开启网页即用,无需App。 AI写作对话 2025年06月05日 15 点赞 0 评论 867 浏览
图应 图应是一款基于AIGC技术的AI商拍工具,专为电商领域设计,通过AI生成高质量商品图像,支持模特与场景定制,具备智能编辑功能。其应用场景涵盖广告创意、印刷出版、服装时尚等领域,显著提升商业视觉效果,降低拍摄成本并提高效率。 AI项目与工具 2025年06月12日 60 点赞 0 评论 866 浏览
通义千问AI大模型 通义千问大模型AI开放平台,覆盖语言、听觉、多模态等领域;致力于实现接近人类智慧的通用智能,让AI从“单一感官”到“五官全开” Ai平台模型 2025年06月05日 18 点赞 0 评论 865 浏览
Vision Search Assistant Vision Search Assistant (VSA) 是一种结合视觉语言模型与网络代理的框架,旨在提升模型对未知视觉内容的理解能力。它通过网络检索,使 VLMs 能够处理和回答有关未见图像的问题。VSA 在开放集和封闭集问答测试中表现出色,支持图像描述生成、网络知识搜索、协作生成等功能,可应用于图像识别、新闻分析、教育、电商和旅游等多个领域。 AI项目与工具 2025年06月12日 100 点赞 0 评论 859 浏览
WorldScore WorldScore是由斯坦福大学推出的统一世界生成模型评估基准,支持3D、4D、图像到视频(I2V)和文本到视频(T2V)等多种模态。它从可控性、质量和动态性三个维度进行评估,涵盖3000个测试样本,包括静态与动态、室内与室外、逼真与风格化等多种场景。WorldScore具备多场景生成、长序列支持、图像条件生成、多风格适配等功能,适用于图像到视频、图像到3D生成以及自动驾驶场景模拟等应用,为研究 AI项目与工具 2025年06月12日 87 点赞 0 评论 858 浏览
WeShop商拍 WeShop是国内首款AI商拍工具,专注于电商产品图片的智能生成。它旨在帮助品牌商家解决商品图拍摄成本高、模特贵等痛点,同时提供高效且成本效益高的解决方案。 Ai绘画生成 2026年06月23日 0 点赞 0 评论 856 浏览