# Document chunker

Découpe un document long en chunks indexés qui peuvent ensuite être recherchés, classés ou transmis à un agent IA.

## Configuration

- **Clé du contexte en entrée** : chemin vers un texte, un objet JSON ou une liste de textes. Tapez `{` pour utiliser l’autocomplétion.
- **Mode de découpage** :
  - **Paragraphes** conserve les blocs de paragraphes.
  - **Phrases** regroupe des phrases complètes.
  - **Caractères** crée des fenêtres de taille fixe.
- **Taille du chunk** : nombre maximal de caractères par chunk, entre 100 et 20 000.
- **Chevauchement** : caractères répétés entre deux chunks consécutifs. Cette valeur doit être inférieure à la taille du chunk.
- **Métadonnées JSON** : objet optionnel copié dans chaque chunk, par exemple une source, une langue ou l’identifiant du document.

## Entrée de test sûre

Une liste de textes évite les erreurs JSON provoquées par un retour à la ligne placé dans une chaîne :

```json
{
  "question": "Comment réinitialiser mon mot de passe ?",
  "document": [
    "Pour créer un compte, renseignez votre adresse email.",
    "Si vous avez oublié votre mot de passe, cliquez sur Mot de passe oublié.",
    "Un lien de réinitialisation est envoyé par email et reste valide pendant 30 minutes.",
    "Les factures sont disponibles dans la section Facturation."
  ]
}
```

Configuration de test recommandée :

```text
Clé du contexte en entrée : {input.document}
Mode de découpage : Paragraphes
Taille du chunk : 150
Chevauchement : 20
```

Document Chunker rassemble automatiquement une liste de textes avec des séparateurs de paragraphes avant le découpage.

## Structure de sortie

```json
{
  "chunks": [
    {
      "index": 0,
      "text": "Pour créer un compte...",
      "length": 52,
      "start": 0,
      "end": 52,
      "metadata": {
        "source": "support"
      }
    }
  ],
  "count": 1,
  "chunk_size": 150,
  "overlap": 20,
  "split_mode": "paragraph"
}
```

Pour un Reranker placé ensuite, sélectionnez `{outputs.<identifiant_chunker>.parsed}`, puis utilisez `chunks` comme chemin de liste et `text` comme chemin du texte.

## Sortie runtime

Le nœud écrit son résultat principal dans `last_output` et, quand la sortie est structurée, dans `last_output_parsed`. Les nœuds aval peuvent référencer les sorties nommées via `{outputs.<node_id>.parsed}`.

## Exemple workflow

Utilisez la carte workflow ci-dessous pour créer un exemple fonctionnel dans l’éditeur. Elle utilise des données de test sûres et évite les effets externes sauf si le nœud est lui-même une intégration sortante.

---

*Source: https://agentbuilder.systalink.sn/docs/node-document-chunker — human documentation.*
*Other language: [/docs-md/en/node-document-chunker.md](/docs-md/en/node-document-chunker.md).*
*Machine-readable index: [/llms.txt](/llms.txt).*
