Projet

Général

Profil

Actions

Bug #15488

fermé

Les entités HTML des contenus WYSIWYG ne sont pas décodées lors de l'indexation Lucene

Bug #15488: Les entités HTML des contenus WYSIWYG ne sont pas décodées lors de l'indexation Lucene

Ajouté par Sebastien Vuillet il y a 8 jours. Mis à jour il y a 8 jours.

Statut:
Closed
Priorité:
Normal
Assigné à:
Catégorie:
Moteur de recherche
Version cible:
-
Début:
28/09/2026
Echéance:
% réalisé:

0%

Temps estimé:
Navigateur:
Tous
Votre version de Silverpeas:
6.4
Système d'exploitation:
Livraison en PROD:

Description

Contexte

Les contenus WYSIWYG des publications Kmelia sont stockés dans des fichiers *wysiwyg_<lang>.txt. Ces fichiers contiennent du HTML et les caractères accentués sont enregistrés sous forme d'entités HTML (é, à, etc.).

Exemple de contenu réel d'un fichier WYSIWYG :

<p>fusée<br />
fusee<br />
ergothérapeute<br />
exilé<br />
démission<br />
restauré</p>

Lors de l'indexation, certaines recherches sur des mots accentués ne renvoient pas les publications attendues.

Reproduction
Créer une publication Kmelia contenant les mots suivants :
fusée
fusee
ergothérapeute
exilé
démission
restauré
Réindexer les contenus.
Effectuer les recherches :
fusée
fusee
ergothérapeute
ergotherapeute
démission
demission

Le terme eacute apparaît dans l'index, ce qui indique que le HTML n'a pas été interprété avant analyse.

TikaParser crée actuellement un Metadata vide avant l'appel à Tika, ce qui laisse Tika détecter le type à partir de l'extension .txt.

Le contenu est alors interprété comme du texte brut au lieu de HTML.

Cause

Le MIME type (text/html) présent dans FileDescription n'est pas propagé jusqu'à TikaParser.


Demandes liées 1 (0 ouverte — 1 fermée)

Lié à Silverpeas Core - Bug #15370: Recherche de terme contenant des caractères spéciaux provenant du WYSIWYGClosedMiguel Moquillon25/06/2026

Actions
Actions

Formats disponibles : PDF Atom