学习

花魁小站

花魁小站是一个开放性的CG游戏美术交流社区,免费分享CG行业资讯,资源,学习为一体的CG美术类平台.

北京大学人工智能研究院

北京大学人工智能研究院(Institute for Artificial Intelligence, Peking University)于2019年4月27日宣布成立,作为学校直属的独立实体机构,是统筹全校相关资源、建设世界一流...

浙江大学人工智能学院

目前有人工智能技术应用、软件技术、计算机应用技术、电子信息工程技术、大数据技术等5个专业。人工智能专业群入选浙江省高职高水平专业群建设名单,专业群由人工智能技术应用、软...

YouTube Dubbing

YouTube Dubbing是一款利用AI技术实现跨语言视频观看的浏览器插件。它通过智能同步配音和字幕翻译功能,帮助用户轻松克服语言障碍,提升视频观看体验。支持多语言、多平台操作,提供多种语音风格和高级功能如倍速播放、背景音保留等,适合语言学习、国际教育、商务会议等多种应用场景。

VoiceCanvas

VoiceCanvas 是一款开源的多语言语音合成平台,基于 AI 技术提供高质量文字转语音服务,支持超过 50 种语言。用户可通过上传简短音频实现个性化声音克隆,并集成多种语音服务以保障输出质量。平台适用于内容创作、教育、企业及个人等多种场景,提升语音内容制作效率。

Concept Lancet

Concept Lancet(CoLan)是一种基于潜在空间稀疏分解的图像编辑框架,能够实现零样本、即插即用的精确概念替换、添加与移除。它通过构建视觉概念字典,结合扩散模型生成高质量图像,保持视觉一致性。适用于创意设计、影视制作、游戏开发等多个领域,提供高效的图像编辑解决方案。

TripoSR

TripoSR是一款由Stability AI与VAST联合开发的开源3D生成模型,能够在不到0.5秒内从单张2D图像生成高质量的3D模型。基于Transformer架构和大型重建模型(LRM)设计,采用先进的图像编码、三平面NeRF表示及优化训练策略,支持无GPU设备运行。适用于游戏开发、影视制作、建筑设计、产品设计等多个领域,具有高效、高精度和广泛适用性的特点。

MineWorld

MineWorld是由微软研究院开发的基于《我的世界》的实时交互式AI模型,采用视觉-动作自回归Transformer架构,实现高保真、可控性强的场景生成。通过并行解码算法,模型可在每秒4至7帧的速度下实现实时交互,适用于具身智能、强化学习、游戏代理及视频生成等场景。其核心技术包括图像与动作标记器、Transformer解码器以及优化的训练与推理流程。

Speak APP

Speak APP是一款基于人工智能技术的英语学习工具,主要聚焦于口语练习。它通过模拟对话、实时反馈及个性化课程设计,助力用户提升发音、语法和词汇水平。其功能涵盖视频教学、角色扮演、ChatBot互动及快速练习,广泛应用于个人自学、考试准备、商务交流、旅游英语及面试场景。