Vision и файлы
Изображения, PDF и документы в запросах
Мультимодальные модели принимают смешанный content: массив объектов с типами text, image_url, file. Поддержка зависит от модели — смотрите input_modalities в каталоге.
Vision: URL-изображения
json
Vision: base64
python
PDF и документы
KodikRouter не создаёт и не сохраняет PDF. Передайте уже существующий файл как подписанный HTTP(S)-URL или как data:application/pdf;base64,.... Плагин file-parser извлечёт текст на стороне шлюза, заменит file-блок обычным text-блоком и только после этого отправит запрос выбранной chat-модели.
Формат file-блока
Используйте поля
file.filename и file.file_data. Поля url и name не входят в поддерживаемый контракт file-parser.json
Движки обработки PDF
pdf-textИзвлекает текст цифрового PDF через pypdf; не требует внешнего API-ключа
mistral-ocrОбрабатывает сканы и сложную вёрстку; на сервере требуется MISTRAL_API_KEY
nativeНе парсит файл и передаёт его модели как есть; модель и провайдер должны поддерживать files
Ограничения
Для воспроизводимой локальной проверки всегда указывайте
pdf.engine: "pdf-text" и используйте PDF с текстовым слоем. Максимальный размер файла по умолчанию — 50 MiB. Извлечённый текст учитывается во входных токенах и может увеличить стоимость запроса. Если извлечение завершится ошибкой, шлюз оставит исходный file-блок для native-обработки провайдером.Аудио и другие модальности
Аудио-модели (STT/TTS) доступны через /v1/audio/transcriptions и /v1/audio/speech. Документация готовится.
