Erreur Tesseract fr

Bonjour,

J’ai eu un document PDF pour lequel l’OCR n’a pas fonctionné à l’import (à cause d’un nombre trop important de pages peut-être ?). J’ai du coup créé un dataset avec les pages dactylographiées puis lancer un worker Tesseract fr inférence mais le processus (Arkindex 1.12.2) a échoué, et je n’ai pas pu faire de configuration spécifique.

Merci pour votre aide !

Bonjour,

tu as une erreur dans les logs

2026-07-20 14:48:42,009 WARNING/arkindex_worker: An API error occurred while processing element d943e147-9159-45cf-a072-803046573255: 400 Bad Request - {‘element_type’: [‘Object with slug=paragraph does not exist.’]}

il manque un type paragraph dans les éléments du projet. Peux tu le créer et essayer à nouveau ?

Christopher

Bonjour Christopher,

Effectivement en rajoutant paragraph et word ça a fonctionné.
Par contre, j’obtiens l’OCR en paragraphe alors qu’à l’import il se fait en lignes, ce qui pose un problème de cohérence avec les autres PDF …
Merci !

tu as aussi les transcriptions au niveau ligne et mot normalement.

Oui effectivement mais le format n’est pas le même que sur les autres PDF et je souhaiterai que ce soit unifié. Et quand je supprime le paragraphe, cela supprime aussi les lignes (qui en sont les enfants). J’ai aussi essayé de recharger le PDF en le divisant en 2 mais l’OCR ne se fait toujours pas à l’import. À quoi cela est-il dû ?

il n’y a pas d’OCR à l’import. Si le PDF contient une couche texte, elle est importée avec les images, s’il n’y en a pas, tu n’as pas d’élément paragraph/text line/word de créés.

Quelle est ton organisation cible pour les transcriptions ?

Juste les lignes (text_line) avec la transcription par ligne.

dans tes documents actuels, tu as des éléments Ligne dactylographiée Arkindex 1.12.2

Tu les convertis après l’OCR ?

En effet, tesseract génère toute la hiérarchie mais ce serait configurable.

Oui j’ai vu, je voudrais simplement ne pas avoir les paragraphes et les mots et ne conserver que les lignes, si c’est effectivement configurable ça serait l’idéal (je pensais que ça serait possible avec une configuration spécifique au moment de lancer le worker) :slight_smile: