Bug #15488
ferméLes entités HTML des contenus WYSIWYG ne sont pas décodées lors de l'indexation Lucene
0%
Description
Contexte
Les contenus WYSIWYG des publications Kmelia sont stockés dans des fichiers *wysiwyg_<lang>.txt. Ces fichiers contiennent du HTML et les caractères accentués sont enregistrés sous forme d'entités HTML (é, à, etc.).
Exemple de contenu réel d'un fichier WYSIWYG :
<p>fusée<br />
fusee<br />
ergothérapeute<br />
exilé<br />
démission<br />
restauré</p>
Lors de l'indexation, certaines recherches sur des mots accentués ne renvoient pas les publications attendues.
Reproduction
Créer une publication Kmelia contenant les mots suivants :
fusée
fusee
ergothérapeute
exilé
démission
restauré
Réindexer les contenus.
Effectuer les recherches :
fusée
fusee
ergothérapeute
ergotherapeute
démission
demission
Le terme eacute apparaît dans l'index, ce qui indique que le HTML n'a pas été interprété avant analyse.
TikaParser crée actuellement un Metadata vide avant l'appel à Tika, ce qui laisse Tika détecter le type à partir de l'extension .txt.
Le contenu est alors interprété comme du texte brut au lieu de HTML.
Cause
Le MIME type (text/html) présent dans FileDescription n'est pas propagé jusqu'à TikaParser.