Image vers texte (OCR)

Extrayez le texte de photos, captures d’écran et numérisations dans le navigateur, puis modifiez-le, copiez-le ou enregistrez-le en .txt. Rien n’est envoyé.

Le formulaire interactif est prêt lorsque JavaScript est activé.

Mode d’emploi

Choisissez une ou plusieurs images, faites-les glisser sur l’outil ou collez une capture d’écran avec Ctrl+V. L’outil les lit l’une après l’autre et réunit tout le texte dans une seule zone, où vous pouvez le corriger avant de le copier ou de le télécharger dans un fichier .txt. Avec plusieurs images, chacune commence par une ligne indiquant son nom de fichier, pour que vous sachiez d’où vient chaque partie.

Choisissez la langue du texte avant d’ajouter les images. Si vous la changez ensuite, ou si vous changez l’ordre de lecture, les images sont relues. La langue compte, car elle indique au moteur quelles lettres et quels accents attendre : un texte portugais lu comme de l’anglais peut perdre des accents comme ç et ã. L’ordre de lecture compte pour la mise en page : « Ligne par ligne » garde ensemble chaque ligne d’un tableau ou d’un ticket de caisse, tandis que « Colonnes et blocs » lit une page en colonnes une colonne à la fois.

Le moteur de reconnaissance est Tesseract, le moteur d’OCR open source, qui s’exécute dans votre navigateur en WebAssembly. Vos images ne sont envoyées ni à nTools ni à aucun autre service. La première fois, le navigateur télécharge le moteur (environ 1,5 Mo) et les données de la langue choisie (de 0,7 à 3 Mo) ; ensuite, ils proviennent normalement du cache du navigateur.

Le moteur a été entraîné sur du texte imprimé. L’écriture manuscrite n’est pas prise en charge, et les photos floues, le texte incliné, les lettres très petites, les polices décoratives et le texte clair sur un fond chargé produisent tous des erreurs. Les petites images, comme la plupart des captures d’écran, sont agrandies automatiquement avant d’être lues, ce qui aide pour les petits textes d’interface. La confiance affichée est l’estimation du moteur lui-même, calculée en moyenne sur le texte qu’il a trouvé : c’est un signal d’alerte utile, pas une garantie ; vérifiez donc les noms, les nombres et les montants en les comparant avec l’image.

Les fichiers TIFF sont lus page par page, y compris les numérisations de plusieurs pages et les fichiers compressés en ZIP, LZW, JPEG ou CCITT (fax). Les photos JPEG et HEIC sont remises à l’endroit grâce à leurs informations d’orientation, mais un texte tourné sur le côté ou à l’envers dans l’image elle-même n’est pas redressé. Chaque image peut atteindre 30 Mo, 40 mégapixels et 12 000 pixels par côté, et jusqu’à 20 fichiers peuvent être lus à la fois (un TIFF de plusieurs pages compte pour un seul fichier).

Exemple

  • Capture d’écran d’un message d’erreur (PNG)Le message sous forme de texte, à coller dans une recherche ou une demande d’assistance.
  • Photo d’une lettre imprimée, prise bien de face (JPEG)Le texte de la lettre, prêt à être corrigé et enregistré dans un fichier .txt.
  • TIFF de plusieurs pages issu d’un scannerLe texte de chaque page, chacune précédée du nom du fichier et du numéro de page.
  • Photo d’un ticket de caisse, lue ligne par ligneChaque article à côté de son prix, sur la même ligne. Vérifiez les montants : un 5 peut être lu comme un S, ou une virgule comme un point.

Questions fréquentes

Mes images sont-elles envoyées ?

Non. Le texte est reconnu dans votre navigateur, et les images comme le texte restent sur votre appareil. Le navigateur ne télécharge depuis nTools que ce dont il a besoin pour les lire : le moteur de reconnaissance, les données de langue et, pour les fichiers TIFF ou HEIC, un décodeur. Aucune image ni aucun texte n’est envoyé avec ces requêtes.

L’outil peut-il lire l’écriture manuscrite ?

Non. Le moteur a été entraîné sur du texte imprimé : l’écriture manuscrite donne donc de mauvais résultats, sauf si elle est très régulière, proche des majuscules d’imprimerie.

Pourquoi une partie du texte est-elle fausse ou manquante ?

Les causes habituelles sont une photo floue ou inclinée, des lettres petites ou pâles, un fond chargé ou une langue mal choisie. Prenez la photo bien de face et avec un bon éclairage, ou recadrez l’image sur le texte, puis réessayez. Pour les tableaux et les tickets de caisse, utilisez l’ordre de lecture « Ligne par ligne ».

Puis-je extraire le texte d’un PDF ?

Pas ici : cet outil lit des images. Si le PDF a été numérisé, convertissez ses pages en images PNG à 144 DPI avec l’outil « PDF vers images », puis lisez ces images. Si vous pouvez sélectionner le texte dans le PDF, c’est déjà du texte : le copier est donc plus précis que l’OCR.

La mise en forme est-elle conservée ?

Non. Le résultat est du texte brut avec des retours à la ligne, sans polices, gras, colonnes ni tableaux. C’est ce que contient un fichier .txt.

Outils associés