code 发布厂商:Lumina

Chunkr

Lumina AI 推出的开源文档处理API

5
⭐⭐⭐⭐
0 条评测
价格机制 免费+付费
开发者架构组 Lumina
收录发布日期

工具简介与核心定位

Chunkr 是 Lumina AI 推出的开源文档处理 API,专为 RAG(检索增强生成)和知识库场景设计。Chunkr 能将复杂文档(如 PDF、PPT、Word、图片等)转换为结构化数据,支持多格式智能解析。Chunkr 核心功能包括高精度 OCR、语义分块、多格式输出(HTML、Markdown、JSON、纯文本)及与多种 LLM(如 OpenAI、Claude、Ollama 等)的无缝集成。用户能通过云服务快速上手,或用 Docker 在本地部署。Chunkr 在文档问答、企业知识库、OCR 场景和 RAG 系统中表现出色,是文档处理的强大工具。

ADK 综合性能评测

AI 能力 0%
易用性 0%
性价比 0%
性能表现 0%
社区生态 0%
综合评分 50%

核心特色与功能亮点 (Key Features)

多格式文档解析:支持 PDF、PPT、Word、图片等多种格式,能将复杂文档转换为结构化数据。
高精度 OCR:提取文本的同时保留文字的空间关系和位置信息,支持带边界框的 OCR。
语义分块:自动将文档切分成适合 RAG 和 LLM 的上下文块,便于后续处理。
多格式输出:支持用 HTML、Markdown、JSON 和纯文本等多种格式输出结果。
Python SDK:提供 Python SDK,方便直接集成到 Python 应用或后端服务。
LLM 支持:支持多种本地或远程的 LLM(如 OpenAI、Claude、Ollama 等),能灵活配置。

典型应用场景与适用行业

软件开发

核心能力

多格式文档解析:支持 PDF、PPT、Word、图片等多种格式,能将复杂文档转换为结构化数据。 高精度 OCR:提取文本的同时保留文字的空间关系和位置信息,支持带边界框的 OCR。 语义分块:自动将文档切分成适合 RAG 和 LLM 的上下文块,便于后续处理。 多格式输出:支持用 HTML、Markdown、JSON 和纯文本等多种格式输出结果。 Python SDK:提供 Python SDK,方便直接集成到 Python 应用或后端服务。 LLM 支持:支持多种本地或远程的 LLM(如 OpenAI、Claude、Ollama 等),能灵活配置。 代码辅助

官方新手上手实操教程指南

1-STEP TUTORIAL
1

Cloud API方式:注册chunkr.ai账号获取API密钥,通过Python SDK或REST API上传文档(PDF/PPT/Word/图片),指定输出格式(HTML/Markdown/JSON),API返回结构化解析结果。开源方式:GitHub克隆lumina-ai-inc/chunkr仓库,自行部署,使用社区模型进行OCR和布局分析。免费版每月200页无需付费即可测试。

Cloud API方式:注册chunkr.ai账号获取API密钥,通过Python SDK或REST API上传文档(PDF/PPT/Word/图片),指定输出格式(HTML/Markdown/JSON),API返回结构化解析结果。开源方式:GitHub克隆lumina-ai-inc/chunkr仓库,自行部署,使用社区模型进行OCR和布局分析。免费版每月200页无需付费即可测试。

关于 Chunkr 的常见问题

Q: Chunkr和传统OCR工具有什么区别?

Chunkr专为RAG和LLM场景设计,不仅做OCR文字提取,还进行:1)布局分析——保留表格、图文混排的空间关系;2)语义分块——自动将文档切分为适合LLM上下文的逻辑块;3)多格式输出——HTML/Markdown/JSON,直接对接AI应用。传统OCR只输出纯文本,丢失结构信息。

Q: Chunkr开源版和云API版有什么区别?

开源版使用社区模型,OCR和布局分析精度较低,不支持Excel解析,需自行部署和维护。云API版使用Lumina专有优化模型,精度更高,支持Excel,全托管无需运维。免费版每月200页可充分测试。

关联底层 AI技术 百科

点击查看 Chunkr 的底层模型原理,深入探索大算力神经网络构成: