La plateforme

La plateforme, en long et en large

Un pipeline DSPM complet (découverte, extraction, détection, classification, analyse, reporting et gouvernance) exécuté sans agent, on-premise chez vous, en local et sans dépendance cloud, ou en cloud managé. Voici comment chaque étage fonctionne, de la source brute jusqu'au rapport d'audit.

Multi-sourceconnecteurs & catégories
Détection fiablecontrôles de validation
Précision + IAmodes d'analyse + vision
Multi-formatrapports d'audit
Étage 1 · Découverte

Découverte multi-source, agentless et en flux

Le scanner parcourt vos sources en flux : il ne charge jamais un fichier entier en mémoire. Aucun agent à déployer sur les cibles. De nombreux connecteurs répartis en plusieurs catégories, pilotés depuis un binaire unique.

Un inventaire déterministe, pas un best-effort

Chaque exécution s'appuie sur un journal d'inventaire persistant qui matérialise l'état exact de la découverte. C'est ce qui rend l'inventaire reproductible et auditable d'un scan à l'autre.

  • Clés canoniques : chaque objet reçoit une identité stable, indépendante des aléas de listing.
  • États suivis : pending / processing / done / skipped / error, avec horodatages.
  • Raisons de skip consignées, pour expliquer pourquoi un objet n'a pas été analysé.
  • Empreinte d'inventaire : pour comparer la cohérence entre deux exécutions.
  • Passes de réconciliation sur les échecs transitoires, sans tout rescanner.
inventaire · état d'un objet
# Entrée du journal d'inventaire persistant
clé        : smb://srv/rh/exports/2026-q2.xlsx
état       : done
first_seen : 2026-06-28T08:11:04Z
last_seen  : 2026-06-28T08:12:37Z
skip_raison: -
empreinte  : b2f9…a17c

# Objet ignoré (tracé, pas perdu)
clé        : smb://srv/rh/~lock.tmp
état       : skipped
skip_raison: extension exclue

De nombreux connecteurs, plusieurs catégories

Fichiers & partages, bases SQL, stockage objet, SaaS collaboratif, dépôts de code, entre autres, couverts par un seul moteur. Voir les connecteurs

Parcours en flux

Le contenu est traité par morceaux : pas de fichier entier en mémoire, pas d'explosion mémoire sur les très gros volumes.

Ordonnancement résilient

Le listing des sources continue de progresser même quand l'extraction de contenu sature : pas de blocage en cascade.

Étage 2 · Extraction

Extraction de contenu : un large éventail de formats, texte et image

Pour détecter, il faut d'abord lire. Le scanner s'appuie sur une extraction de texte et une reconnaissance optique intégrées pour transformer n'importe quel document en texte exploitable, avec des garde-fous anti-saturation mémoire.

Extraction de texte

Extraction de texte sur un large éventail de formats : documents Office, PDF, images et bien d'autres. Une seule chaîne d'extraction unifiée.

Reconnaissance optique

Reconnaissance de caractères sur les images et documents scannés : PNG, JPG, PDF, TIF, WebP… Le texte « dans l'image » devient détectable.

Détection MIME

Le type réel du fichier est identifié indépendamment de son extension, pour router l'extraction vers le bon traitement.

Protection mémoire

Un plafond de contenu extrait par fichier protège la mémoire contre les documents piégés ou démesurés, avec repli automatique.

Étage 3 · Détection

Le moteur de détection : déterministe, précis, traçable

Le cœur du produit. Une détection précise combine plusieurs signaux pour établir un score de confiance, retenu uniquement au-dessus de seuils explicites, pour des résultats peu bruités et justifiables.

Des preuves hiérarchisées

Chaque signal détecté joue un rôle qui détermine sa contribution à la décision finale :

  • Preuve principale : le signal qui porte la détection.
  • Renfort : consolide une détection existante.
  • Contexte : confirme la pertinence de la détection.
  • Exclusion : atténue ou écarte un faux positif.

Chaque détection reçoit un score de confiance et n'est retenue qu'au-delà de seuils de fiabilité explicites : la précision reste maîtrisée, le bruit reste bas.

scanner.exe · décision de détection (extrait)
# Preuves hiérarchisées
tag          : PII_IBAN
principale   : détection IBAN
renfort      : mot-clé "RIB"
contexte     : fenêtre autour du motif
exclusion    : "exemple"
validateur   : clé de contrôle ✓

confiance    : élevée
seuils       : au-dessus du seuil
décision     : RETENU

Normalisation & contexte

Normalisation des séparateurs puis re-vérification des limites de mots pour capter les formats réels (IBAN espacé, numéros tronqués). Une fenêtre de contexte confirme la pertinence.

Haute performance

Détection robuste et prévisible par défaut ; accélération haute performance activable en option, adaptée aux très gros volumes.

Plusieurs contrôles de validation

Plusieurs contrôles de validation sur les données à clé de contrôle : carte bancaire, IBAN, BIC, OACI, MRZ, NIR, TVA, SIRET, SIREN, téléphone, et d'autres, plus vos propres contrôles personnalisés.

Carte bancaireIBANBIC SIRENSIRETTVA FRNIR MRZOACITéléphone FR Contrôles personnalisés
Étage 4 · Classification

Classification : format, sensibilité, ciblage

Une fois détectée, chaque donnée est rangée. Le format est inféré automatiquement, la sensibilité est portée par le tag, et le ciblage permet de concentrer l'analyse là où c'est utile.

Plusieurs formats

Chaque donnée est typée selon sa structure — structurée, semi-structurée ou non structurée — avec inférence automatique du format quand il n'est pas déclaré.

Sensibilité par tag

Chaque tag porte un niveau : CRITIQUE, ÉLEVÉE, MOYENNE ou BASSE, pour prioriser le risque et filtrer les rapports.

Catégories

Les tags se regroupent en catégories métier, pour structurer l'inventaire et la lecture des résultats.

tag · ciblage fichier (extrait)
# Ciblage par extension & motifs glob
tag          : SECRET_CREDENTIALS
sensibilité  : CRITIQUE
format       : non structuré
extensions   : [".env", ".pem", ".key"]
glob         : ["*.env*", "credentials*"]
catégorie    : sécurité / secrets

Cibler par extension & motifs glob

Inutile d'analyser tout pour tout. Un tag peut restreindre son périmètre aux fichiers qui comptent, par extension ou par motifs glob.

  • Par extension : appliquer un tag uniquement aux formats pertinents.
  • Par motif glob : ex. *.env*, credentials* pour traquer les secrets.
  • Inférence de format automatique quand le format n'est pas explicite.
Étage 5 · Modes d'analyse

Plusieurs modes d'analyse + vision multimodale

Choisissez le compromis vitesse / finesse pour chaque scan : de la détection déterministe à l'analyse adaptative, jusqu'à l'analyse directe des images par l'IA vision.

Déterministe

Détection déterministe et rapide sur les données à clé de contrôle. Idéal pour IBAN, cartes et identifiants nationaux.

IA

Analyse sémantique par IA pour les données contextuelles : noms, santé, RH, contrats, là où la détection de motifs ne suffit pas.

Analyse combinée

La détection déterministe pré-filtre, l'IA confirme les cas ambigus avec des extraits de contexte ciblés. Le meilleur des deux approches.

Analyse adaptative

Le bon traitement appliqué automatiquement à chaque type de donnée, sans réglage manuel.

IA adaptative

Priorisation IA adaptative à budget plafonné : l'IA est concentrée là où elle apporte le plus, sous contrôle de coût.

Vision multimodale

Images et PDF envoyés directement à l'IA vision, texte extrait en renfort, avec un envoi résilient qui s'adapte au fournisseur.

Étage 6 · Intelligence artificielle

Une couche IA résiliente, branchée sur vos modèles

L'IA est un renfort, pas une boîte noire. Multi-fournisseurs compatibles OpenAI, supervisée et bridée par des garde-fous, et capable de traiter de très gros fichiers en streaming.

Multi-fournisseurs, supervisée

  • Compatible OpenAI : branchez n'importe quel fournisseur compatible, dans votre infrastructure ou en cloud.
  • Streaming des réponses, avec repli automatique si un fournisseur défaille.
  • Multi-instances avec supervision de santé pour répartir la charge.
  • Auto-découverte de la fenêtre de contexte du modèle.
  • Garde anti-hallucination et anti-injection sur les sorties du modèle.
couche IA · pipeline & repli
# API compatible OpenAI
api         : compatible OpenAI
streaming   : on
contexte    : auto

# Multi-instances supervisées
instance #1  : santé ✓  →  actif
instance #2  : repli   (automatique)

# Garde-fous
anti_halluc : on
anti_inject : on

# Gros fichiers
streaming   : fichiers volumineux
Fournisseurs compatibles
& tout fournisseur compatible OpenAI

Pipeline de streaming pour très gros fichiers

Sur les fichiers volumineux, le contenu est traité par flux dans la couche IA : pas de chargement intégral, pas de saturation mémoire, même sur des documents démesurés.

Étage 7 · Reporting & preuves

Des rapports d'audit à votre charte, des preuves masquées

L'aboutissement du pipeline : des rapports exploitables par les équipes conformité, sécurité et direction, entièrement personnalisables, avec des preuves qui n'exposent jamais la donnée sensible en clair.

Plusieurs formats de sortie

PDF, DOCX, Excel, HTML, Markdown et Bundle ZIP, entre autres : du livrable de direction au lot de preuves complet.

Tableau de bord DSPM

Une vue de synthèse de la posture : volumes, niveaux de sensibilité et répartition du risque sur l'ensemble des sources.

Preuves masquées

Les extraits qui justifient une détection sont masqués : la preuve est traçable, la donnée sensible reste protégée.

Personnalisation du rapport

  • Double logo et page de garde dédiée.
  • Palette de couleurs et polices à votre charte.
  • Métadonnées & versioning du document.
  • Orientation, mode compact et filigrane.
  • Filtrage par niveau de risque.

De nombreuses sections modulaires, activables à la demande

Le rapport se compose comme un document à tiroirs : activez uniquement les sections utiles à votre audience, filtrez par niveau de risque, et habillez le tout à votre identité visuelle.

  • De nombreuses sections modulaires activables indépendamment.
  • Filtrage par niveau de risque pour cibler le contenu.
  • Plusieurs formats au choix selon le destinataire.
Étage 8 · Intégration

API REST & Job Builder : pilotez tout, localement

Tout le pipeline est scriptable et administrable. Un serveur REST embarqué pour l'automatisation, une interface graphique embarquée pour composer vos scans, sans CDN ni service tiers, et sans aucune dépendance externe en on-premise.

Serveur REST embarqué

Une API REST complète : lancez des scans, suivez l'avancement, récupérez les résultats et générez les rapports par programme. L'intégration dans vos chaînes d'outils est native.

Job Builder

Interface d'administration servie localement, sans CDN, pour composer visuellement sources, tags, réglementations et jobs, le tout sans écrire de JSON à la main.

Étage 9 · Gouvernance & fiabilité

Une plateforme qui se surveille elle-même

Au-delà de la détection, le scanner instrumente son propre fonctionnement : intégrité d'inventaire, saturation des files, santé de l'IA et regroupement des erreurs. De quoi exploiter en confiance, à l'échelle.

Intégrité d'inventaire

L'inventaire s'auto-évalue : complet (rien d'oublié) et reproductible d'une exécution à l'autre, la base d'une preuve de conformité.

Saturation des files

Métriques de saturation sur les files de traitement IA, détection et extraction, pour repérer les goulets d'étranglement.

Suivi multi-fournisseurs IA

Comptage des requêtes, des tokens et de la santé d'instance par fournisseur : visibilité et maîtrise des coûts.

Regroupement des erreurs

Les erreurs sont regroupées automatiquement par cause, pour diagnostiquer vite plutôt que de noyer l'opérateur sous les logs.

Tout le pipeline DSPM, chez vous ou en cloud managé

Téléchargez le scanner en on-premise ou optez pour l'offre de cloud managé, branchez une première source et obtenez un rapport d'audit complet : découverte, détection, classification et preuves.