R

Kimi

Kimi-VL是月之暗面推出的轻量级多模态视觉语言模型,支持图像、视频、文档等多种输入形式。其基于轻量级MoE架构和原生分辨率视觉编码器,具备强大的图像感知、数学推理和OCR能力。在长上下文(128K)和复杂任务中表现优异,尤其在多模态推理和长视频理解方面超越同类模型。适用于智能客服、教育、医疗、内容创作等多个领域。

Aero

Aero-1-Audio 是一款基于 Qwen-2.5-1.5B 的轻量级音频模型,拥有 1.5 亿参数,专注于长音频处理,支持连续 15 分钟音频输入并保持上下文连贯性。在语音识别、复杂音频分析及指令驱动任务中表现出色,具备高效的训练方法和多任务处理能力,适用于语音助手、实时转写、归档理解等场景。

德克萨斯大学奥斯汀分校

德克萨斯大学奥斯汀分校(University of Texas at Austin,简称:UT-Austin)创建于1883年,是得克萨斯大学系统的旗舰校区,位于美国德克萨斯州首府奥斯汀市,是一所顶尖公立研究型...

即刻创作

一个免费在线AI图文创作平台,提供强大丰富的图文AI创作能力 , Xdraw图文编辑器、图片格式转换、自由裁剪等多种免费功能 ,快速创作您的作品。

WebPilot.Ai

一款可以与网页进行自由对话的免费开源的AI工具,具有网页内容的智能问答和总结功能,用户可以从输入的网站中获取网站页面的信息。

PDF to Podcast

PDF to Podcast 是一款由 NVIDIA 开发的 AI 工具,能够将 PDF 文档自动转换为高质量的音频内容,如播客。该工具结合了大型语言模型、文本到语音技术以及 NVIDIA NIM 微服务架构,支持从 PDF 提取信息并生成结构化文本,再通过语音合成输出自然流畅的音频。用户可自定义生成内容的重点,并支持多种部署方式,适用于企业培训、技术简报、客户服务、医疗教育等多个领域。

BGE

BGE-VL是由北京智源研究院联合高校开发的多模态向量模型,基于大规模合成数据MegaPairs训练,具备高效的多模态数据合成方法和强大的泛化能力。它支持图文检索、组合图像检索和多模态嵌入等功能,适用于智能搜索、内容推荐、图像编辑辅助等多个领域。模型在多种任务中表现优异,尤其在组合图像检索方面取得显著成果。

马萨诸塞大学阿默斯特分校

马萨诸塞大学,又译麻省大学(University of Massachusetts,简称UMASS),是美国公立大学系统。马萨诸塞大学起源于1863年建立在美国麻省安姆斯特镇(Amherst)的马萨诸塞大学阿默...