学习

Stable Video 3D (SV3D)

Stable Video 3D(SV3D)是一款由Stability AI公司开发的多视角合成和3D生成模型,能够从单张图片生成一致的多视角图像,并进一步优化生成高质量的3D网格模型。该模型在视频扩散模型基础上进行改进,提供更好的质量和多视角体验。主要功能包括多视角视频生成、3D网格创建、轨道视频生成、相机路径控制以及新视角合成。SV3D在新视角合成方面取得显著进展,能够生成逼真且一致的视图,提升

HART

HART是一种由麻省理工学院研究团队开发的自回归视觉生成模型,能够生成1024×1024像素的高分辨率图像,质量媲美扩散模型。通过混合Tokenizer技术和轻量级残差扩散模块,HART实现了高效的图像生成,并在多个指标上表现出色,包括重构FID、生成FID以及计算效率。

SVFR

SVFR是一款由腾讯优图实验室与厦门大学联合开发的视频人脸修复框架,能够统一处理视频中的人脸修复、着色和缺失区域补全任务。基于Stable Video Diffusion模型,结合任务嵌入、统一潜在正则化等技术,提升修复精度与时间稳定性。适用于影视后期、网络视频制作及数字档案修复等领域,具有广泛的应用价值。

Midjourney 学习导航

坦率说来,线性的教程,并不是学习 Midjourney 最好的方法,可能未来有了 AI 技术后,我能制作一个更牛逼的教程。为了能让不同水平的朋友快速了解和学会 Midjourney ,我特意制作了本学习导航,希望它能帮助你更好地学习。如果你是想教小朋友如何使用孩子是人类的未来,所以如果你有小孩,不妨跟小朋友一起学习 不过很抱歉,因为身边没有可实验的样本,所以可能需要你根据小朋友的情况,对这份导航进

BALROG

BALROG是一款用于评估大型语言模型(LLMs)和视觉语言模型(VLMs)在游戏环境中推理能力的框架。它通过程序化生成的游戏环境,测试模型的规划、空间推理及探索能力,并提供细粒度的性能指标和公开排行榜,以促进AI技术的发展,适用于游戏AI开发、机器人技术、虚拟现实等多个领域。

原子回声AtomGPT大模型

原子回声AtomGPT大模型是一个不断学习和进步的中文大模型项目,它通过向用户展示模型的学习过程,提供了一个参与和观察模型成长的平台。

卡内基梅隆大学

卡内基梅隆大学(Carnegie Mellon University),简称CMU,是坐落于美国宾夕法尼亚州的匹兹堡的私立大学,“新常春藤”,全球大学校长论坛成员。拥有14,800名在校学生和1,483名教职...

斯坦福大学

斯坦福大学(Stanford University),全名小利兰·斯坦福大学(Leland Stanford Junior University),简称“斯坦福”,位于美国加州旧金山湾区南部帕罗奥多市境内,临近高科技园区硅...

Versatile

Versatile-OCR-Program是一款开源多模态OCR工具,支持从教育材料中提取文本、公式、表格等结构化数据,输出为JSON或Markdown格式,准确率高达90%-95%。它基于DocLayout-YOLO、Google Vision和MathPix等技术,支持多语言处理,适用于教育数据集制作、教学辅助、AI模型训练及个人学习等场景。

AiPathly

AiPathly是一款面向希望进入AI领域的专业人士的综合性平台,提供个性化技能评估、定制学习路径、职业匹配报告及实时行业洞察等功能。用户可通过模拟项目积累实践经验,并借助简历和作品集优化服务提升求职竞争力。无论是职业转型者、技能提升者还是学生群体,均可借助AiPathly实现高效成长与成功转型。