Извлечение данных из любых документов
Попробуйте бесплатно — без привязки карты.
Зарегистрируйтесь, сгенерируйте API-ключ — и отправляйте тестовые запросы бесплатно. Без привязки карты и платёжных данных: регистрация, ключ — и можно тестировать.
Не знаете, с какой модели начать? Загляните в сравнение LLM по цене и интеллекту и документацию — подберёте вариант под задачу и бюджет.
попробовать бесплатно →curl -X POST https://api.hotdoc.io/v1/jobs \
-H "Authorization: Bearer chunkchef_<id>.<secret>" \
-H "Content-Type: application/json" \
-d '{
"sourceUrls": ["https://example.com/invoice.pdf"],
"title": "Invoice #42",
"prompts": ["Extract the invoice number, date, supplier, line items, and total. Return strict JSON."],
"ocr": { "provider": "NEURAL_CLIENT_TYPE_MISTRAL", "model": "mistral-ocr-latest", "providerKey": "<YOUR_KEY>" },
"neural": {
"type": "NEURAL_CLIENT_TYPE_XIAOMI",
"model": "mimo-v2-flash",
"apiKey": "<YOUR_PROVIDER_KEY>",
"reasoningEffort": "low"
}
}' Пайплайн от импорта файлов
до JSON за один API-запрос.
ChunkChef — это слой оркестрации над OSS-библиотеками: распаковываем архивы, читаем 20+ форматов, прогоняем через OCR и отправляем распознанный текст в модель с вашим промптом. Вы передаёте ссылки на файлы и промпт, модель выбираете сами. А выбрать помогает наше сравнение LLM по цене и интеллекту. Остальное на нашей стороне.
Вы платите за оркестратор, надёжность (ретраи и восстановление), инфраструктуру, поддержку и выверенные пайплайны под проблемные кейсы. Никаких наценок за OCR и токены.
Посмотреть документациюПервичная обработка
Распаковываем архивы, читаем 20+ форматов нативно, а сканы и изображения обрабатываем через Vision OCR.
Извлечение данных
Поля, которые нужны, вы описываете в промпте; мы применяем его к распознанному тексту. Модель выбираете под каждый запрос. Длинный текст делим структурно-осведомлённым чанкингом — таблицы и секции не рвутся, — поэтому модель всегда работает на чистом небольшом фрагменте, и качество держится при любом объёме.
Результат и контроль
Возвращаем ответ модели и статус по каждому файлу. Ошибки приходят пофайлово — логика остаётся за вами: повторить, сменить модель или обработать иначе.
Структурированный результат
Получаете результат текстом — JSON, CSV или Markdown — в форме, заданной вашим промптом и выбранной моделью.
Нужна классификация или свой кастомный флоу?
Напишите намНе OSS.
Не enterprise API.
Нечто другое.
| | OSS | Funded API | ChunkChef |
|---|---|---|---|
| Полноценный флоу обработки | ✗ | ✓ | ✓ |
| Zero-ops (не деплоить) | ✗ | ✓ | ✓ |
| Контроль используемых инструментов | ✓ | ✗ | ✓ |
| BYOK | ✓ | ✗ | ✓ |
| Отсутствие переплат за токены | ✓ | ✗ | ✓ |
| Поддержка | ✗ | ✓ | ✓ |
| Скорость интеграции | недели | дни | часы |
Между «собери сам» и «переплати за токены» мы предлагаем третий вариант: готовый инструмент без наценки.
ChunkChef vs OSS (Docling, Marker и др.) Только парсинг — OCR, вызовы модели и оркестрацию вы собираете сами, плюс держите GPU. Затраты могут превышать $1000 ещё до первого результата. Мы даём готовую инфраструктуру и проверенные пайплайны — без возни с первичной обработкой на вашей стороне.
ChunkChef vs funded API (Reducto, Unstructured и др.) Монетизация большинства продуктов строится на наценке на токены. Чем больше вы тратите — тем больше комиссий вы платите. Мы берём фиксированную стоимость за использование инструментов, а вы используете собственные API-ключи и не переплачиваете за токены.
Архитектура и
методы обработки
Детерминированный оркестратор и точечный AI. Каждый шаг управляем, каждая ошибка обрабатывается, каждый результат воспроизводим.
BYOK: ваш ключ провайдера принимается только на вход, не возвращается в ответах, хранится только в зашифрованном виде и удаляется вместе с задачей.
Популярные сценарии
Частые задачи, которые закрываются «из коробки». Нестандартное — настроим флоу.
Invoice Extraction API
Инвойсы и счета любых форматов — в структурированный JSON по вашему промпту. Пакет файлов за одну задачу.
Resume / CV Parser API
Поток CV на любом языке — в унифицированные карточки кандидатов со скорингом по вашим критериям.
Bank Statement Extraction
Выписки из разных банков — в единый формат транзакций. Работает с PDF и Excel-экспортами.
Batch / Archive Processing
ZIP с сотнями файлов разных форматов — один запрос, один JSON. Статус каждого файла в батче.
Нестандартная задача? Настроим флоу.
напишите намТребуются большие объёмы, self-hosted
или выделенная инфраструктура?
Что входит
Токены не дорогие сами по себе — дорогими их делают те, кто стоит между вами и провайдером.
Funded-компании берут ваши файлы, прогоняют через Claude или GPT и выставляют $10+ за тысячу страниц. На этом строится их маржа. Чем больше объёмы, тем больше переплата за токены.
Мы решили сделать иначе: подключаете свой ключ, платите провайдеру напрямую, а нам фиксированную стоимость за готовое решение. Не потому что мы не хотим заработать больше. А потому что согласно нашей картине мира так правильнее.
Ограниченное хранение
Файлы, промежуточные данные и результаты удаляются автоматически (по умолчанию — 7 дней).
Шифрование на всех уровнях
TLS при передаче, шифрование at-rest. Доступ только по API-ключу.
BYOK — ключ остаётся вашим
Принимается только на вход, не возвращается, хранится зашифрованным и удаляется вместе с задачей.
On-prem / VPC по запросу
Полная изоляция для Enterprise и self-host.