工具

LDGen

LDGen是一款结合大型语言模型与扩散模型的文本到图像生成工具,支持零样本多语言生成,提升图像质量和语义一致性。通过分层字幕优化、LLM对齐模块和跨模态精炼器,实现文本与图像的高效交互。实验表明其性能优于现有方法,适用于艺术创作、广告设计、影视制作等多个领域,具备高效、灵活和高质量的生成能力。

百度AI助手

百度AI灵感中心,打开即用、提供大量 AI 应用场景的 AI 助手。

MoMask

MoMask是一款基于生成式掩码建模的3D人体动作生成工具,支持文本驱动的动作创建与编辑。采用分层量化与Transformer架构,实现高精度、连贯的3D动作序列生成,在HumanML3D数据集上的FID值仅为0.045。支持动作时序控制、多平台部署及动作评估功能,适用于游戏开发、动画制作、VR及体育分析等多个领域。

S2V

S2V-01是MiniMax研发的视频生成模型,基于单图主体参考架构,可快速生成高质量视频。它能精准还原图像中的面部特征,保持角色一致性,并通过文本提示词灵活控制视频内容。支持720p、25fps高清输出,具备电影感镜头效果,适用于短视频、广告、游戏、教育等多种场景,具有高效、稳定和高自由度的特点。

Ovis2

Ovis2是阿里巴巴国际团队开发的多模态大语言模型,采用结构化嵌入对齐技术提升视觉与文本的融合效果。支持视频、图像和多语言处理,强化了思维链推理和复杂场景下的OCR能力。提供多个参数规模的版本,适用于研究、开发及各类应用场景,展现卓越性能。

Gamma App

在线网页版创建演示文稿的工具

花生图像

一个专为电商卖家设计的工具,支持在线抠图改图,商品图片自动去除背景,跨境电商图片翻译,自动识别图片文字,助力商家降本增效。

Rox

Rox 是一款专注于销售领域的AI平台,通过智能代理技术提升客户关系管理与销售流程效率。它能够自动收集和整合客户数据,生成个性化内容,自动化处理任务,并提供深度数据分析,助力销售团队制定精准策略。Rox 支持实时更新和系统集成,适用于客户拓展、会议支持、信息管理和营销互动等多个场景。

入梦AI变声器

入梦AI变声器提供了丰富的声音变化选项,从儿童的高亢声音到成年男性的低沉音调,用户可以根据自己的需求进行选择。

Upscale.Media

Upscale.Media,将您的图像放大到2倍或4倍而不失真,轻松增强低质量图像。