开源专题

Tesseract

Tesseract是一款开源的光学字符识别（OCR）引擎，支持多语言识别和多种图像格式。其具备高精度的文字识别能力，适用于文档数字化、表格数据提取、发票识别及移动OCR应用等多个场景。支持跨平台运行，并提供丰富的编程接口和自定义训练功能，便于开发者集成和优化识别效果。

AI项目与工具 2025年06月12日 12 点赞 0 评论 725 浏览

unsloth

Unsloth 是一款高效开源的LLM微调工具，通过优化计算流程和GPU内核设计，大幅提升训练速度并降低内存占用。支持多种主流大模型，提供动态量化、长上下文支持等功能，适用于学术研究、企业应用及资源受限环境中的模型优化。

AI项目与工具 2025年06月12日 44 点赞 0 评论 932 浏览

FlowiseAI

FlowiseAI 是一款开源的低代码 AI 工具，允许用户通过可视化拖拽方式快速构建大型语言模型应用。支持多模型集成、对话记忆、API 接口等功能，适用于聊天机器人、工作流自动化和文档问答等多种场景。提供本地、Docker 和云平台部署方式，适合开发者和企业用户进行灵活应用开发。

AI项目与工具 2025年06月12日 18 点赞 0 评论 499 浏览

ChatTTSPlus

ChatTTSPlus 是一款基于深度学习的语音合成工具，它通过 TensorRT 技术实现了显著的性能提升，同时支持语音克隆、模型压缩与加速等功能。该工具不仅适用于桌面端，还能够部署于移动设备，满足多种应用场景需求，包括有声读物制作、语言学习辅助、客户服务及娱乐等领域。 ---

AI项目与工具 2025年06月12日 13 点赞 0 评论 781 浏览

VideoChat

VideoChat是一款开源的实时数字人对话系统，支持语音输入与实时对话功能。用户可自定义数字人形象与音色，实现音色克隆。系统集成多种技术，包括语音识别、大语言模型生成及文本转语音，支持流式视频输出，适用于客户服务、在线教育、新闻播报、直播互动及娱乐等多个领域。

AI项目与工具 2025年06月12日 35 点赞 0 评论 892 浏览

MiniCPM

MiniCPM-o 2.6 是一款高性能的多模态大模型，具备 8B 参数量，支持视觉、语音及多模态直播等多种功能。其在图像处理、语音识别和实时交互方面表现优异，采用高效的 token 技术提升推理速度，可在端侧设备上运行。支持多种语言和音色配置，适用于智能助手、内容创作、教育、客服和医疗等多个领域。

AI项目与工具 2025年06月12日 58 点赞 0 评论 749 浏览

书生·万象InternVL 2.5

书生·万象InternVL 2.5是一款开源多模态大型语言模型，基于InternVL 2.0升级而来。它涵盖了从1B到78B不同规模的模型，支持多种应用场景，包括图像和视频分析、视觉问答、文档理解和信息检索等。InternVL 2.5在多模态理解基准上表现优异，性能超越部分商业模型，并通过链式思考技术提升多模态推理能力。

AI项目与工具 2025年06月12日 100 点赞 0 评论 789 浏览

Animate

Animate-X 是一个基于 Latent Diffusion Model 的通用动画框架，可将静态图像转化为高质量的动态视频，特别适合拟人化角色动画的生成。它通过引入隐式和显式姿势指示器，增强了对运动模式的捕捉能力，并支持多种角色类型，无需严格对齐。该工具在游戏开发、影视制作、虚拟现实及社交媒体内容创作等方面具有广泛应用价值。 ---

AI项目与工具 2025年06月12日 27 点赞 0 评论 577 浏览