Structure de l'objet de configuration OCR
Vue d'ensemble
L'objet ocr vous permet de configurer les paramètres de reconnaissance optique de caractères (OCR) pour l'application, permettant l'extraction de texte à partir d'images. Cette section fournit une analyse détaillée de la structure de l'objet ocr.
Il y a 4 champs principaux sous ocr :
mistralModelapiKeybaseURLstrategy
Notes :
- Si vous utilisez l'API Mistral OCR, vous n'avez pas besoin de modifier votre fichier
librechat.yaml.- Vous n'avez besoin que des variables d'environnement suivantes pour commencer :
OCR_API_KEYetOCR_BASEURL.
- Vous n'avez besoin que des variables d'environnement suivantes pour commencer :
- La fonctionnalité OCR permet à l'application d'extraire du texte à partir d'images, qui peut ensuite être traité par des modèles d'IA.
- La stratégie par défaut est
mistral_ocr, qui utilise les capacités OCR de Mistral. - Vous pouvez également configurer un service OCR personnalisé en définissant la stratégie sur
custom_ocr. - Les modèles Mistral OCR déployés sur Azure peuvent être utilisés en définissant la stratégie sur
azure_mistral_ocr. - Les modèles Mistral OCR déployés sur Google Vertex AI peuvent être utilisés en définissant la stratégie sur
vertexai_mistral_ocr.- Nécessite que la variable d'environnement
GOOGLE_SERVICE_KEY_FILEsoit définie avec les identifiants du compte de service. - La clé de service peut être fournie sous forme de : chemin de fichier, URL, JSON encodé en base64 ou chaîne JSON brute
- L'ID du projet et l'emplacement sont automatiquement extraits des identifiants du compte de service.
- Nécessite que la variable d'environnement
- L'extraction de texte locale est disponible via
document_parser, qui extrait le texte des fichiers PDF, DOCX, XLS/XLSX et OpenDocument sans aucune API externe.- Utilise
pdfjs-dist,mammothetSheetJSlocalement — aucune clé API ou URL de base n'est requise - Seul le champ
strategyest requis ;apiKey,baseURLetmistralModelsont ignorés
- Utilise
- Si vous utilisez le Mistral OCR par défaut, vous pouvez éventuellement spécifier un modèle Mistral particulier à utiliser.
- L'analyse des variables d'environnement est prise en charge pour les paramètres
apiKey,baseURLetmistralModel. - Une option de stratégie
user_providedest prévue pour les prochaines versions, mais n'est pas encore implémentée.
Analyse automatique de documents (aucune configuration requise)
Le document_parser intégré s'exécute automatiquement pour les téléchargements de fichiers par l'agent, même lorsqu'aucun bloc ocr n'est configuré dans votre librechat.yaml. Cela signifie que les fichiers PDF, DOCX, XLS/XLSX et ODS sont analysés immédiatement sans aucune configuration requise.
La logique de résolution fonctionne comme suit :
-
Aucune configuration
ocrn'existe — Lorsqu'un fichier de contexte d'agent est téléchargé et que son type MIME correspond à un type de document pris en charge (PDF, DOCX, Excel, ODS), ledocument_parserest utilisé directement. Aucune vérification de capacité OCR n'est requise pour l'agent. -
ocrconfig exists — La stratégie configurée (par ex.mistral_ocr) est tentée en premier. Si la stratégie configurée échoue lors de l'exécution, ledocument_parserest utilisé comme solution de secours afin que l'extraction de texte réussisse toujours pour les types de documents pris en charge. -
Aucun des deux ne réussit — Si la stratégie configurée et l'analyseur de document échouent tous deux (par exemple, le fichier est un PDF composé uniquement d'images sans texte intégré), une erreur est renvoyée suggérant qu'un service OCR est nécessaire.
Le document_parser ne gère que les documents textuels. Pour les PDF basés sur des images ou les documents numérisés, vous devez toujours disposer d'une stratégie OCR configurée (telle que mistral_ocr) pour extraire le texte des images contenues dans ces fichiers.
Exemple
ocr:
mistralModel: "mistral-ocr-latest"
apiKey: "your-mistral-api-key"
strategy: "mistral_ocr"Exemple avec OCR personnalisé :
ocr:
apiKey: "your-custom-ocr-api-key"
baseURL: "https://your-custom-ocr-service.com/api"
strategy: "custom_ocr"Exemple avec Azure Mistral OCR :
ocr:
mistralModel: "deployed-mistral-ocr-2503" # should match deployment name on Azure
apiKey: "${AZURE_MISTRAL_OCR_API_KEY}" # arbitrary .env var reference
baseURL: "https://your-deployed-endpoint.models.ai.azure.com/v1" # hardcoded, can also be .env var reference
strategy: "azure_mistral_ocr"Exemple avec Google Vertex AI Mistral OCR :
ocr:
mistralModel: "mistral-ocr-2505" # model name as deployed in Vertex AI
strategy: "vertexai_mistral_ocr"Exemple avec un analyseur de documents local (aucune API externe requise) :
ocr:
strategy: "document_parser"mistralModel
| Key | Type | Description | Example |
|---|---|---|---|
| mistralModel | String | Le modèle Mistral à utiliser pour le traitement OCR. Pour les déploiements Azure, cela doit correspondre à votre nom de déploiement. Pour Google Vertex AI, cela doit correspondre au nom du modèle dans votre déploiement. | Optional. Specifies which Mistral model should be used when the strategy is set to mistral_ocr, azure_mistral_ocr, or vertexai_mistral_ocr. |
ocr:
mistralModel: "mistral-ocr-latest"Pour les déploiements Azure :
ocr:
mistralModel: "deployed-mistral-ocr-2503" # Your Azure deployment namePour les déploiements Google Vertex AI :
ocr:
mistralModel: "mistral-ocr-2505" # Your Vertex AI model nameapiKey
| Key | Type | Description | Example |
|---|---|---|---|
| apiKey | String | La clé API pour le service OCR. Non utilisée pour Google Vertex AI (utilise l'authentification par compte de service via GOOGLE_SERVICE_KEY_FILE). | Optional. Defaults to the environment variable OCR_API_KEY if not specified. |
ocr:
apiKey: "your-ocr-api-key"baseURL
| Key | Type | Description | Example |
|---|---|---|---|
| baseURL | String | L'URL de base pour l'API du service OCR. Pour Google Vertex AI, celle-ci est automatiquement construite à partir des identifiants du compte de service. | Optional. Defaults to the environment variable OCR_BASEURL if not specified. |
ocr:
baseURL: "https://your-ocr-service.com/api"strategy
| Key | Type | Description | Example |
|---|---|---|---|
| strategy | String | La stratégie OCR à utiliser. | Determines which OCR service to use. Options are "mistral_ocr", "azure_mistral_ocr", "vertexai_mistral_ocr", "document_parser", or "custom_ocr". Defaults to "mistral_ocr". |
ocr:
strategy: "custom_ocr"Stratégies disponibles :
mistral_ocr: Utilise les capacités OCR de Mistral via l'API standard Mistral API.azure_mistral_ocr: Utilise les modèles Mistral OCR déployés sur Azure AI Foundry.vertexai_mistral_ocr: Utilise les modèles Mistral OCR déployés sur Google Cloud Vertex AI.document_parser: Utilise l'extraction de texte locale pour les fichiers PDF, DOCX, XLS/XLSX et OpenDocument. Aucune API externe n'est nécessaire. S'exécute également automatiquement pour les téléchargements de fichiers par l'agent lorsqu'aucune configurationocrn'est présente, et en tant que solution de secours lorsqu'une stratégie OCR configurée échoue.custom_ocr: Utilise un service OCR personnalisé spécifié par labaseURL(pas encore implémenté).
Que pensez-vous de ce guide ?