Chaque document importé dans Blast Audit passe par l’OCR (reconnaissance optique de caractères). L’OCR repère chaque mot de la page et enregistre sa position. Les snips, la recherche dans la visionneuse, le rapprochement de documents et l’extraction s’appuient tous sur ce texte : un document doit donc avoir terminé son OCR avant que vous puissiez l’utiliser. Aucun réglage ne permet de sauter l’OCR.
Comment un document est lu
Blast Audit choisit la méthode pour chaque document au moment de l’import.
| Document | Méthode | Affiché comme |
|---|---|---|
| PDF qui contient déjà du texte (exporté d’un logiciel comptable, d’un portail bancaire, de Word) | Le texte est lu directement dans le PDF. Quelques secondes suffisent. | Texte PDF |
| Scan, photo ou PDF sans texte | Les images des pages sont lues par l’OCR visuel. C’est plus long. | OCR visuel |
Pour un PDF lu depuis son propre texte, la page Documents indique : « Document prêt : le texte a été lu directement depuis le PDF. Lancez l’OCR visuel uniquement si certains snips semblent erronés ou manquants. » Certains PDF contiennent un texte caché qui ne correspond pas à la page. Dans ce cas, cliquez sur le bouton ⋮ au bout de la ligne du document, puis sur Lancer l’OCR visuel.
Suivre la progression
Pendant l’import, le volet passe par Envoi des fichiers, Préparation en cours et Lecture des documents. Gardez Excel ouvert et restez sur la page Documents jusqu’à la fin. Si vous quittez la page pendant l’import, le résultat de l’OCR peut être perdu et vous devrez relancer l’OCR.
La colonne Statut OCR indique où en est chaque document :
| Statut | Signification |
|---|---|
| Non démarré / OCR requis | L’OCR n’a pas tourné. Cliquez sur Lancer l’OCR. |
| En file d’attente | En attente de son tour. |
| En cours | En cours de lecture. |
| Terminé | Prêt pour les snips, le rapprochement et l’extraction. |
| Échec OCR | Cliquez sur Relancer l’OCR dans le menu ⋮ du document. |
Relancer l’OCR relit le document avec l’OCR visuel. Si la relance échoue, Blast Audit conserve le résultat précédent.
Quota OCR
L’OCR visuel décompte les pages sur un quota mensuel partagé par toute votre organisation : environ 10 000 pages par utilisateur et par mois, mutualisées. Un PDF dont tout le texte est lisible à l’import évite l’OCR et ne compte pas. Quand un document nécessite l’OCR, toutes ses pages comptent. Quand le quota est atteint, le volet vous le signale, et les documents non traités restent sur OCR requis. Renseignez-vous auprès de votre administrateur sur la consommation de votre organisation. Le quota est inclus avec vos licences : voir Choisir une offre, acheter des licences ou demander un devis.
Où tourne l’OCR
L’OCR visuel tourne sur Microsoft Azure. L’article Où sont stockées vos données précise où les documents sont traités et combien de temps ils sont conservés.
Problèmes liés
Si l’OCR reste En cours, échoue ou ne trouve aucun texte, voir Débloquer un OCR bloqué, lent ou en échec.