Suppression OCR import

Bonjour

Sur Arkindex, je souhaiterais supprimer les polygones d’OCR produits à l’import d’un document. Les supprimer manuellement dans l’outil “Annotation” fonctionne mais est laborieux : je souhaiterais pouvoir sélectionner plusieurs pages et supprimer tous les polygones en une fois. Quand j’essaie dans “Actions” (après avoir sélectionné les pages en questions) puis “Delete worker results”, soit je supprime toute la page, soit cela ne fait rien. J’ai essayé en utilisant l’ID du process dans le mode avancé mais ça supprime également toute la page.

Merci

Bonjour Léa,

tu peux en effet supprimer des éléments:

  • en sélectionnant le worker qui les a généré, mais dans ton cas, le worker d’import a généré à la fois les pages et les lignes de texte, donc ca supprime les deux
  • en les mettant manuellement dans la sélection puis, dans la sélection “delete selected elements”, mais c’est un peu long dans ton cas
  • en les filtrant avec la “magic bar” puis en appliquant “delete filtered elements”. C’est la méthode la plus appropriée dans ton cas.

Bonjour Christopher,

Merci pour ta réponse.
Le soucis des différentes options proposées, c’est que la suppression reste manuelle (il faut sélectionner chaque ligne à supprimer) et dans la “magic bar”, je n’arrive pas à uniquement sélectionner les pages manuscrites d’un PDF qui a des pages à la fois manuscrites et dactylographiées. Est-ce que je pourrais faire, par exemple, un dataset avec toutes les pages manuscrites et supprimer uniquement sur ces pages-ci les résultats de l’OCR ?

peux-tu me donner un lien vers ton corpus et m’indiquer quels éléments tu veux supprimer ?

merci,

Par exemple dans ce PDF : Arkindex 1.12.2
Je voudrais supprimer les résultats de l’OCR, comme la ligne ‘92a90eee-a2c2-4f5b-8d63-654a4f98dd4d’ sur la page 14, par exemple.

Si tu utilises un filtrer sur

https://pictoria-doc.huma-num.fr/element/d72e5fde-0f3e-4488-a21a-a4a7d3ecc3c6?type=text_line&recursive=true

puis que tu utilises le menu Elements->delete filtered elements , ca fait ce que tu veux ?

Non car, pour chaque PDF, j’ai à la fois des lignes dactylographiées et manuscrites et je souhaite seulement supprimer les polygones sur les pages manuscrites (donc sur certaines) (par exemple, ce polygone : Arkindex 1.12.2 mais pas celui là : Arkindex 1.12.2)
La seule solution que j’ai trouvé c’est de faire page par page

mais, si ça supprime bien dans les résultats avec la barre, les polygones sont toujours là sur l’image (Arkindex 1.12.2)

Il faut refresh la page pour que les enfants soient mis à jour, ils devraient disparaitre.

Mais en effet, pour le faire sur toutes les pages, il te faut un script :

Dis-moi si ca fonctionne.

Malheureusement non … Même en rafraichissant les polygones générés à l’import sont toujours là : Arkindex 1.12.2

Mais plus rien dans la barre de recherche

Tu as un filtre “name contain 10” qui sélectionne uniquement les lignes avec “10” dans le nom. Ceux-là ont dû être détruits


Je fais “name contains 10” pour avoir uniquement la page 10 (et donc seulement les lignes manuscrites de la page 10). Du coup quelle est la bonne syntaxe ?

tu ne peux pas faire de requête combinée sur les parents et les enfants dans la barre de filtrage : “tous les enfants text_line des pages dont le nom contient 10” n’est pas faisable. Il faut utiliser un script.