
Des documents absents de la recherche ne justifient pas automatiquement une réindexation complète. Il faut d’abord distinguer un retard d’indexation, un nœud en erreur et un problème de communication avec Solr, puis collecter les preuves avant de choisir la correction.
Chez Rainbow Intégration, nous voyons souvent des équipes perdre plusieurs heures sur une réindexation globale alors qu’un diagnostic cible aurait permis d’isoler la cause, de mesurer l’impact reel et de revenir à un service de recherche normal sans prise de risque inutile. Cet article propose une méthode praticable pour Alfresco Community, depuis l’observation des compteurs jusqu’à la réindexation ciblee.
Ce que signifient vraiment unindexed nodes et ErrorNode
Les unindexed nodes designent des éléments connus du referentiel mais pas encore correctement pris en compte dans l’index de recherche. Ce n’est pas toujours un symptôme critique. Pendant une charge importante, une reprise de service, une migration ou une reconstruction en cours, ce compteur peut temporairement augmenter avant de revenir a zero.
Le signal devient utile quand le compteur stagne, progresse sans redescendre ou s’accompagne de plaintes utilisateurs sur des documents introuvables. Il faut alors vérifier si l’on parle d’un simple retard de traitement, d’un goulot sur les transformations de contenu, ou d’un échec plus structurel entre le repository et Solr.
Les ErrorNode, eux, meritent davantage d’attention. Ils indiquent que certains nœuds ont rencontre une erreur explicite pendant l’indexation. Dans ce cas, attendre ne suffit pas toujours. Il faut identifier le type de contenu concerne, la période d’apparition, puis remonter à la cause technique avant de relancer quoi que ce soit.
Premier réflexe : vérifier si l’indexation est en retard ou bloquée
Avant de toucher à la configuration, il faut examiner l’état global des trackers et le decalage entre la base et l’index. Si les transactions continuent d’avancer, si le volume de contenu a absorber est important et si les compteurs diminuent, la bonne décision est souvent de laisser terminer. Une action trop precoce peut ajouter du bruit et rallonger l’incident.
En revanche, si le TX Lag, le Change Set Lag ou les compteurs d’indexation cessent de bouger pendant une longue période, vous n’etes plus dans un simple retard. Le problème se situe alors du côté des trackers, de la communication entre Alfresco et Solr, de la transformation documentaire ou de la sante generale de l’environnement.
Ce premier cadrage est complementaire d’un diagnostic plus large sur Solr. Si vous devez revoir les symptômes de desynchronisation, vous pouvez aussi consulter notre guide sur le diagnostic Solr et la réindexation dans Alfresco.
Les causes fréquentes derriere ces compteurs
1. Transformation de contenu defaillante
De nombreux cas viennent d’un moteur de transformation qui ne traite plus certains formats. PDF scannes, documents bureautiques volumineux, fichiers proteges ou formats atypiques peuvent provoquer une absence de texte indexable. Le repository contient bien le document, mais Solr ne recoit pas un contenu exploitable dans de bonnes conditions.
Quand ce scenario apparait après une modification d’infrastructure ou une montee de charge, il faut vérifier en priorité les composants de transformation, leur dimensionnement et leurs logs. Notre article sur Alfresco Transform Service aide a reconnaitre les symptômes qui y sont lies.
2. Desynchronisation temporaire après restart ou maintenance
Après un redémarrage non coordonne, une reprise d’index ou un changement de configuration, il n’est pas rare d’observer des unindexed nodes pendant un certain temps. Le point clé est de distinguer une file qui se vide d’une file qui se fige. Dans le premier cas, il faut surtout monitorer. Dans le second, il faut enqueter.
3. Problèmes cibles sur certains nœuds
Un fichier corrompu, des métadonnées anormales, une propriétés custom mal mappee ou une surcharge ponctuelle peuvent suffire a créer un petit nombre d’ErrorNode. C’est exactement le type de situation ou une réindexation globale est disproportionnee. Une analyse par lot ou par nœud est plus rapide et plus sure.
4. Mauvaise lecture du symptôme
Parfois, les compteurs sont interprétés comme un incident d’indexation alors que le vrai problème est un droit d’accès, une recherche trop restrictive, un filtre utilisateur ou une confusion entre métadonnées et contenu plein texte. Il faut donc confronter les chiffres à des cas de recherche concrets avant de conclure.
La bonne méthode de diagnostic en 5 étapes
Étape 1 : mesurer l’impact métier
Listez quelques documents que les utilisateurs disent introuvables. Verifiez s’ils existent bien dans le repository, si leur contenu devrait être indexable, et si l’absence concerne toute la base ou seulement certaines familles documentaires. Cette étape évite de traiter un faux positif comme un incident systemique.
Étape 2 : interroger les compteurs Solr
Relevez les valeurs Alfresco Unindexed Nodes, Alfresco Error Nodes in Index, les lags, ainsi que l’activité recente des trackers. Prenez deux ou trois mesures espacees dans le temps. Sans cette comparaison, vous ne savez pas si la situation s’aggrave, se stabilise ou se resorbe.
Étape 3 : identifier la population touchee
Quand c’est possible, recherchez si les nœuds concernes partagent un type mime, une taille, une période de création, un site ou un modèle de contenu. Cette segmentation est decisive. Un problème cible sur les PDF OCR n’appelle pas la même réponse qu’un blocage general de l’indexation.
Étape 4 : remonter à la cause technique
Consultez les logs Alfresco, Solr et des services de transformation. Cherchez les erreurs récurrentes, les timeouts, les exceptions de parsing, les ruptures de connectivite ou les changements de configuration recents. C’est la cause qu’il faut corriger, pas seulement le symptôme visible dans le compteur.
Étape 5 : réindexer au bon niveau
Une fois la cause comprise, choisissez la réindexation la plus petite possible. Sur quelques nœuds, une relance ciblee suffit souvent. Sur un lot limite, une reprise circonscrite est plus prudente qu’une reconstruction globale. La réindexation complète doit rester une option de dernier recours, reservee aux cas ou l’index dans son ensemble est juge non fiable.
Quand la réindexation complète est justifiée
Elle se defend surtout dans quatre cas : index corrompu, changement majeur d’architecture de recherche, ecart massif et durable entre repository et index, ou reconstruction volontaire dans une fenêtre de maintenance maitrisee. En dehors de ces scenarios, réindexer tout l’environnement augmente les temps de retour à la normale et masque souvent la vraie cause initiale.
Autrement dit, la question n’est pas « peut-on réindexer ? » mais « qu’est-ce que cette réindexation va prouver ou corriger ? » Si la réponse reste floue, il vaut mieux continuer le diagnostic.
Les erreurs a éviter
- Lancer une réindexation complète sans mesurer l’évolution des compteurs.
- Ignorer les logs de transformation alors que seuls certains formats sont touches.
- Confondre incident d’indexation et problème de droits ou de requete utilisateur.
- Corriger l’index avant d’avoir identifié le changement technique qui a déclenché l’anomalie.
- Vérifier uniquement Solr sans contrôler le repository et les services amont.
Ce qu’il faut retenir
Dans Alfresco Community, des unindexed nodes ne signifient pas automatiquement qu’il faut tout reconstruire. Et quelques ErrorNode ne justifient pas, a eux seuls, une opération lourde. La bonne approche consiste a mesurer, qualifier, segmenter, corriger la cause puis réindexer au niveau adapte. Cette discipline reduit le risque, accélère le retour au nominal et évite les interventions spectaculaires mais peu utiles.
Si votre équipe constate une recherche incomplète, des compteurs qui stagnent ou une indexation qui se dégradé après une modification d’infrastructure, Rainbow Intégration peut vous aider a isoler le mécanisme en cause et a choisir la bonne stratégie de correction sur Alfresco Community.
Votre recherche Alfresco est incomplète ou instable ?
Nous pouvons isoler la cause avant toute réindexation lourde.
Besoin d'un accompagnement pour votre projet GED ?
Réservez un diagnostic gratuit de 30 minutes avec notre expert Alfresco
Réserver mon diagnostic