PaliGemma 2 mix PaliGemma 2 Mix 是谷歌 DeepMind 推出的多任务视觉语言模型,支持图像描述、目标检测、OCR、文档理解等功能。模型提供多种参数规模和分辨率选项,适用于不同场景。其基于开源框架开发,易于扩展,可通过简单提示切换任务。适用于科学问题解答、文档分析、电商内容生成等多个领域。 AI项目与工具 2025年06月12日 23 点赞 0 评论 734 浏览
parsio Parsio是一款利用AI技术的文档解析工具,支持从PDF、电子邮件及发票等多种文档中自动提取结构化数据。它提供PDF解析与OCR功能,支持多语言识别和表格提取,适用于业务流程优化、客户关系管理及财务管理等多个领域,帮助企业提高效率并减少错误。 AI项目与工具 2025年06月12日 21 点赞 0 评论 735 浏览
Manga Image Translator Manga Image Translator 是一个开源的漫画图片文字翻译工具,基于 OCR 和机器翻译技术,实现对漫画和图片中文字的自动识别与翻译。它支持多语言翻译,包括日文、中文、英文和韩文,并具备图像合成能力,保持原图风格。工具提供批量处理和在线/离线翻译功能,适用于漫画爱好者、语言学习者以及出版商等用户群体。 AI项目与工具 2025年06月12日 16 点赞 0 评论 746 浏览
OmniParser OmniParser是一款由微软研究院开发的屏幕解析工具,能够将UI截图转换为结构化数据,通过识别可交互图标和提取功能语义,提升基于大型语言模型的UI代理系统的性能。它支持跨平台应用,无需依赖额外信息,适用于自动化软件测试、虚拟助手、辅助技术等多个领域。 AI项目与工具 2025年06月12日 29 点赞 0 评论 748 浏览
看典古籍 一个致力于古籍数字化和保护文化遗产的平台。看典古籍通过先进的OCR算法,将不同版式、年代和字体的古籍转化为数字化内容,提供图文对比阅读和全文搜索功能。 剧本文案 2025年06月05日 83 点赞 0 评论 752 浏览
Marker Marker 是一款开源的高精度文档转换工具,支持 PDF、Word 等多种格式向 Markdown、JSON 和 HTML 的转换。它利用深度学习技术自动去除干扰元素,支持多语言处理,具备表格、代码块、公式识别及图像提取等功能,适用于学术研究、技术文档、教育资料等多种场景。同时支持硬件加速和批量处理,提升转换效率与用户体验。 AI项目与工具 2025年06月12日 26 点赞 0 评论 752 浏览
媒小三 媒小三 ,实用的新媒体工具大全,提供各种实用新媒体工具,如:AI配音,视频解析,短视频下载,文案提取,文章改写,标题生成等功能,帮助新媒体人一站式快捷操作。 Ai办公效率 2025年06月05日 46 点赞 0 评论 756 浏览
智能翻译官 AI智能翻译引擎,涵盖文本、文档、图片、视频、音频等多种在线翻译模式,更有强大的文档格式转换处理功能,为您节约80%的时间。 Ai办公效率 2025年06月05日 55 点赞 0 评论 759 浏览
GOT-OCR2.0 创新的OCR模型,它通过先进的技术提供了精准、高效的OCR解决方案。无论是文档数字化、场景文本识别还是票据处理等应用场景,GOT-OCR 2.0都能提供强大的支持。 Ai平台模型 2026年09月26日 0 点赞 0 评论 763 浏览