Back to Blog
Automation

Extraire les données des documents avec l’OCR dans une automatisation

5 min read
Share:

Intro : L’OCR peut transformer des factures et formulaires en données exploitables, à condition de contrôler les champs, les erreurs et les documents ambigus.

Les PME reçoivent encore beaucoup de documents sous forme de PDF scannés, de photos ou de pièces jointes. Une personne ouvre le fichier, lit quelques champs, puis recopie les informations dans un ERP, un CRM ou un tableur. Cette opération semble simple, mais elle prend du temps et produit des erreurs difficiles à repérer après coup.

Une automatisation avec reconnaissance optique de caractères, ou OCR, peut extraire le texte et certains éléments de structure. Microsoft décrit par exemple des modèles capables d’extraire du texte imprimé ou manuscrit, des tableaux, des paires clé-valeur et des champs de documents financiers dans sa documentation Document Intelligence. L’extraction réduit la saisie manuelle. Elle ne remplace pas une règle de validation adaptée à l’usage.

Commencer par les champs réellement utiles

Le premier travail consiste à définir ce que le processus doit récupérer. Pour une facture, cela peut être le numéro, la date, le fournisseur, le total hors taxe, la TVA et le total toutes taxes comprises. Pour un formulaire, les champs seront différents. Ajouter vingt champs parce que le modèle sait les lire rend la validation plus lourde.

Créez un registre simple avec le nom du champ, son type, son caractère obligatoire et l’action prévue en cas d’absence. Un numéro de facture doit souvent être une chaîne, car les zéros au début peuvent avoir une signification. Un montant doit être converti en nombre selon les séparateurs utilisés dans le document. Une date doit suivre un format unique avant d’entrer dans le système cible.

Le registre permet aussi de séparer les données extraites du texte original. Gardez le fichier source, la page et la zone où le champ a été trouvé. Cette trace aide à vérifier une valeur contestée sans demander au collaborateur de refaire tout le traitement.

Séparer lecture et décision

Une automatisation fiable sépare au moins quatre étapes : réception du document, extraction, validation puis écriture dans le système cible. Cette séparation permet de placer un contrôle au bon endroit.

La réception peut refuser les extensions inconnues et enregistrer l’expéditeur. L’extraction produit des valeurs avec, si le service le fournit, une indication de confiance ou une position dans le document. La validation vérifie les règles métier. L’écriture ne doit intervenir qu’après ce contrôle.

Une valeur lisible n’est pas forcément correcte. Un total peut être bien reconnu alors que le document est attribué au mauvais fournisseur. Le numéro peut respecter le bon format tout en étant déjà utilisé. Comparez donc les champs entre eux et avec les données internes disponibles. Le total d’une facture peut être rapproché des lignes, et le fournisseur peut être rapproché d’un référentiel existant.

Gérer les documents ambigus

Les scans inclinés, les tampons, les tableaux sur plusieurs pages et les photos floues diminuent la qualité de l’extraction. Préparez un chemin d’exception. Il doit conserver le document, les valeurs obtenues et la raison du blocage.

Un seuil unique pour tous les champs est rarement adapté. Le numéro de facture et le montant total n’ont pas la même tolérance. Vous pouvez exiger une vérification humaine lorsque le champ obligatoire manque, lorsque le total calculé ne correspond pas au total lu ou lorsque le fournisseur n’est pas reconnu.

Le collaborateur doit corriger la valeur dans un formulaire court, puis valider l’ensemble du document. Afficher la page et la zone concernée réduit les recherches. Le système doit enregistrer qui a corrigé le champ et quand, surtout si le document déclenche un paiement ou une obligation comptable.

Tester avec un échantillon représentatif

Un test composé uniquement de fichiers propres donne une image trop optimiste. Constituez un échantillon avec les formats habituels, les fournisseurs fréquents, des scans de qualité variable et quelques documents incomplets. Gardez un jeu de contrôle qui ne sert pas à ajuster les règles, puis mesurez séparément le résultat.

Mesurez le taux de champs corrects, le taux de documents envoyés en revue, le temps de correction et les erreurs qui arrivent jusqu’au système cible. Un taux élevé de lecture peut cacher beaucoup de corrections manuelles. À l’inverse, un contrôle plus strict peut réduire les erreurs sans supprimer tout le travail humain.

Commencez avec un seul type de document. Une facture fournisseur est souvent plus simple à cadrer qu’un dossier qui combine plusieurs pièces. Une fois les règles comprises, étendez le processus à un autre modèle et comparez les erreurs plutôt que de mélanger toutes les causes.

Protéger les documents et les données extraites

Les factures et formulaires peuvent contenir des coordonnées bancaires ou des informations personnelles. Définissez qui peut consulter les fichiers originaux, les résultats et les journaux. Les comptes de l’automatisation doivent disposer des droits nécessaires à leur tâche, avec une rotation des secrets et une surveillance des accès.

Décidez aussi de la durée de conservation. Le texte extrait peut être plus facile à rechercher que le PDF original, donc il mérite la même attention. Supprimez les copies temporaires lorsque le processus ne les exige plus, et documentez les destinations utilisées par les erreurs et les reprises.

L’OCR devient utile lorsqu’il enlève une saisie répétitive tout en laissant une trace contrôlable. Un petit périmètre, des règles de validation visibles et un traitement humain des exceptions permettent de mesurer le gain sans transformer chaque document en pari.

Sources

Enjoyed this article? Share it!