
kreuzberg.dev provides a self-hostable document intelligence and RAG platform that extracts, enriches, and retrieves data from 101 file formats and 371 programming languages. The platform offers a four-stage pipeline—Acquire, Extract, Enrich, and Embed & Retrieve—with native SDKs for 15 languages, enabling AI agents to process documents, code, and web content into structured, searchable data. It supports integration with 165 LLM providers for summarization, classification, and embedding tasks.
Funding
Funding not disclosed
Founders
Product
Problem
Organizations building AI agents and RAG systems face significant friction when ingesting diverse document types, source code, and web content. Existing extraction tools are often brittle, template-dependent, or limited in format support, forcing teams to maintain complex, fragmented pipelines that break on edge cases like handwriting, multilingual text, or code syntax.
Solution
kreuzberg.dev offers a self-hostable document intelligence and RAG platform that unifies the entire ingestion pipeline into one backend. The platform's four-stage architecture—Acquire, Extract, Enrich, and Embed & Retrieve—handles crawling, parsing, LLM-based enrichment, and hybrid retrieval in a single API. It supports 101 file formats across 115 file extensions, 371 programming languages via tree-sitter parsing, and integrates with 165 LLM providers for summarization, classification, and embedding. The platform is available as open-source primitives or a managed backend, with native SDKs for 15 programming languages, and can be deployed self-hosted for regulated environments.
Target Audience
Primary customers are AI engineering teams, data platform teams, and organizations building RAG systems, document-reading agents, or replacing legacy IDP workflows. The platform also serves regulated industries needing self-hosted extraction, as well as research projects and non-profits through a design partner program.
Features
- Extract clean, structured text and tables from 101 file formats across 115 file extensions, including PDFs, Office docs, images, and email
- Parse and understand source code across 371 programming languages using tree-sitter for code-aware retrieval and search
- Enrich documents through 165 LLM providers for summarization, classification, entity extraction, translation, and PII redaction
- Built-in RAG capabilities with chunking, embeddings, hybrid retrieval, and reranking for semantic search
- Vision-model OCR for handwriting, messy scans, and multilingual scripts including Arabic, Chinese, Cyrillic, Hindi, and Japanese
- Pre-built document types for invoices, receipts, W-2s, contracts, and IDs with schema-mapped JSON output, plus form-field extraction from fillable PDFs
- Self-hosted deployment option for regulated data, with network boundary enforcement for web crawling
- Native SDKs for 15 languages and a TypeScript SDK for rapid integration