La plateforme, en long et en large
Un pipeline DSPM complet (découverte, extraction, détection, classification, analyse, reporting et gouvernance) exécuté sans agent, on-premise chez vous, en local et sans dépendance cloud, ou en cloud managé. Voici comment chaque étage fonctionne, de la source brute jusqu'au rapport d'audit.
Découverte multi-source, agentless et en flux
Le scanner parcourt vos sources en flux : il ne charge jamais un fichier entier en mémoire. Aucun agent à déployer sur les cibles. De nombreux connecteurs répartis en plusieurs catégories, pilotés depuis un binaire unique.
Un inventaire déterministe, pas un best-effort
Chaque exécution s'appuie sur un journal d'inventaire persistant qui matérialise l'état exact de la découverte. C'est ce qui rend l'inventaire reproductible et auditable d'un scan à l'autre.
- Clés canoniques : chaque objet reçoit une identité stable, indépendante des aléas de listing.
- États suivis :
pending/processing/done/skipped/error, avec horodatages. - Raisons de skip consignées, pour expliquer pourquoi un objet n'a pas été analysé.
- Empreinte d'inventaire : pour comparer la cohérence entre deux exécutions.
- Passes de réconciliation sur les échecs transitoires, sans tout rescanner.
# Entrée du journal d'inventaire persistant clé : smb://srv/rh/exports/2026-q2.xlsx état : done first_seen : 2026-06-28T08:11:04Z last_seen : 2026-06-28T08:12:37Z skip_raison: - empreinte : b2f9…a17c # Objet ignoré (tracé, pas perdu) clé : smb://srv/rh/~lock.tmp état : skipped skip_raison: extension exclue
De nombreux connecteurs, plusieurs catégories
Fichiers & partages, bases SQL, stockage objet, SaaS collaboratif, dépôts de code, entre autres, couverts par un seul moteur. Voir les connecteurs
Parcours en flux
Le contenu est traité par morceaux : pas de fichier entier en mémoire, pas d'explosion mémoire sur les très gros volumes.
Ordonnancement résilient
Le listing des sources continue de progresser même quand l'extraction de contenu sature : pas de blocage en cascade.
Extraction de contenu : un large éventail de formats, texte et image
Pour détecter, il faut d'abord lire. Le scanner s'appuie sur une extraction de texte et une reconnaissance optique intégrées pour transformer n'importe quel document en texte exploitable, avec des garde-fous anti-saturation mémoire.
Extraction de texte
Extraction de texte sur un large éventail de formats : documents Office, PDF, images et bien d'autres. Une seule chaîne d'extraction unifiée.
Reconnaissance optique
Reconnaissance de caractères sur les images et documents scannés : PNG, JPG, PDF, TIF, WebP… Le texte « dans l'image » devient détectable.
Détection MIME
Le type réel du fichier est identifié indépendamment de son extension, pour router l'extraction vers le bon traitement.
Protection mémoire
Un plafond de contenu extrait par fichier protège la mémoire contre les documents piégés ou démesurés, avec repli automatique.
Le moteur de détection : déterministe, précis, traçable
Le cœur du produit. Une détection précise combine plusieurs signaux pour établir un score de confiance, retenu uniquement au-dessus de seuils explicites, pour des résultats peu bruités et justifiables.
Des preuves hiérarchisées
Chaque signal détecté joue un rôle qui détermine sa contribution à la décision finale :
- Preuve principale : le signal qui porte la détection.
- Renfort : consolide une détection existante.
- Contexte : confirme la pertinence de la détection.
- Exclusion : atténue ou écarte un faux positif.
Chaque détection reçoit un score de confiance et n'est retenue qu'au-delà de seuils de fiabilité explicites : la précision reste maîtrisée, le bruit reste bas.
# Preuves hiérarchisées tag : PII_IBAN principale : détection IBAN renfort : mot-clé "RIB" contexte : fenêtre autour du motif exclusion : "exemple" validateur : clé de contrôle ✓ confiance : élevée seuils : au-dessus du seuil décision : RETENU
Normalisation & contexte
Normalisation des séparateurs puis re-vérification des limites de mots pour capter les formats réels (IBAN espacé, numéros tronqués). Une fenêtre de contexte confirme la pertinence.
Haute performance
Détection robuste et prévisible par défaut ; accélération haute performance activable en option, adaptée aux très gros volumes.
Plusieurs contrôles de validation
Plusieurs contrôles de validation sur les données à clé de contrôle : carte bancaire, IBAN, BIC, OACI, MRZ, NIR, TVA, SIRET, SIREN, téléphone, et d'autres, plus vos propres contrôles personnalisés.
Classification : format, sensibilité, ciblage
Une fois détectée, chaque donnée est rangée. Le format est inféré automatiquement, la sensibilité est portée par le tag, et le ciblage permet de concentrer l'analyse là où c'est utile.
Plusieurs formats
Chaque donnée est typée selon sa structure — structurée, semi-structurée ou non structurée — avec inférence automatique du format quand il n'est pas déclaré.
Sensibilité par tag
Chaque tag porte un niveau : CRITIQUE, ÉLEVÉE, MOYENNE ou BASSE, pour prioriser le risque et filtrer les rapports.
Catégories
Les tags se regroupent en catégories métier, pour structurer l'inventaire et la lecture des résultats.
# Ciblage par extension & motifs glob tag : SECRET_CREDENTIALS sensibilité : CRITIQUE format : non structuré extensions : [".env", ".pem", ".key"] glob : ["*.env*", "credentials*"] catégorie : sécurité / secrets
Cibler par extension & motifs glob
Inutile d'analyser tout pour tout. Un tag peut restreindre son périmètre aux fichiers qui comptent, par extension ou par motifs glob.
- Par extension : appliquer un tag uniquement aux formats pertinents.
- Par motif glob : ex.
*.env*,credentials*pour traquer les secrets. - Inférence de format automatique quand le format n'est pas explicite.
Plusieurs modes d'analyse + vision multimodale
Choisissez le compromis vitesse / finesse pour chaque scan : de la détection déterministe à l'analyse adaptative, jusqu'à l'analyse directe des images par l'IA vision.
Détection déterministe et rapide sur les données à clé de contrôle. Idéal pour IBAN, cartes et identifiants nationaux.
Analyse sémantique par IA pour les données contextuelles : noms, santé, RH, contrats, là où la détection de motifs ne suffit pas.
La détection déterministe pré-filtre, l'IA confirme les cas ambigus avec des extraits de contexte ciblés. Le meilleur des deux approches.
Le bon traitement appliqué automatiquement à chaque type de donnée, sans réglage manuel.
Priorisation IA adaptative à budget plafonné : l'IA est concentrée là où elle apporte le plus, sous contrôle de coût.
Images et PDF envoyés directement à l'IA vision, texte extrait en renfort, avec un envoi résilient qui s'adapte au fournisseur.
Une couche IA résiliente, branchée sur vos modèles
L'IA est un renfort, pas une boîte noire. Multi-fournisseurs compatibles OpenAI, supervisée et bridée par des garde-fous, et capable de traiter de très gros fichiers en streaming.
Multi-fournisseurs, supervisée
- Compatible OpenAI : branchez n'importe quel fournisseur compatible, dans votre infrastructure ou en cloud.
- Streaming des réponses, avec repli automatique si un fournisseur défaille.
- Multi-instances avec supervision de santé pour répartir la charge.
- Auto-découverte de la fenêtre de contexte du modèle.
- Garde anti-hallucination et anti-injection sur les sorties du modèle.
# API compatible OpenAI api : compatible OpenAI streaming : on contexte : auto # Multi-instances supervisées instance #1 : santé ✓ → actif instance #2 : repli (automatique) # Garde-fous anti_halluc : on anti_inject : on # Gros fichiers streaming : fichiers volumineux
Pipeline de streaming pour très gros fichiers
Sur les fichiers volumineux, le contenu est traité par flux dans la couche IA : pas de chargement intégral, pas de saturation mémoire, même sur des documents démesurés.
Des rapports d'audit à votre charte, des preuves masquées
L'aboutissement du pipeline : des rapports exploitables par les équipes conformité, sécurité et direction, entièrement personnalisables, avec des preuves qui n'exposent jamais la donnée sensible en clair.
Plusieurs formats de sortie
PDF, DOCX, Excel, HTML, Markdown et Bundle ZIP, entre autres : du livrable de direction au lot de preuves complet.
Tableau de bord DSPM
Une vue de synthèse de la posture : volumes, niveaux de sensibilité et répartition du risque sur l'ensemble des sources.
Preuves masquées
Les extraits qui justifient une détection sont masqués : la preuve est traçable, la donnée sensible reste protégée.
Personnalisation du rapport
- Double logo et page de garde dédiée.
- Palette de couleurs et polices à votre charte.
- Métadonnées & versioning du document.
- Orientation, mode compact et filigrane.
- Filtrage par niveau de risque.
De nombreuses sections modulaires, activables à la demande
Le rapport se compose comme un document à tiroirs : activez uniquement les sections utiles à votre audience, filtrez par niveau de risque, et habillez le tout à votre identité visuelle.
- De nombreuses sections modulaires activables indépendamment.
- Filtrage par niveau de risque pour cibler le contenu.
- Plusieurs formats au choix selon le destinataire.
API REST & Job Builder : pilotez tout, localement
Tout le pipeline est scriptable et administrable. Un serveur REST embarqué pour l'automatisation, une interface graphique embarquée pour composer vos scans, sans CDN ni service tiers, et sans aucune dépendance externe en on-premise.
Serveur REST embarqué
Une API REST complète : lancez des scans, suivez l'avancement, récupérez les résultats et générez les rapports par programme. L'intégration dans vos chaînes d'outils est native.
Job Builder
Interface d'administration servie localement, sans CDN, pour composer visuellement sources, tags, réglementations et jobs, le tout sans écrire de JSON à la main.
Une plateforme qui se surveille elle-même
Au-delà de la détection, le scanner instrumente son propre fonctionnement : intégrité d'inventaire, saturation des files, santé de l'IA et regroupement des erreurs. De quoi exploiter en confiance, à l'échelle.
Intégrité d'inventaire
L'inventaire s'auto-évalue : complet (rien d'oublié) et reproductible d'une exécution à l'autre, la base d'une preuve de conformité.
Saturation des files
Métriques de saturation sur les files de traitement IA, détection et extraction, pour repérer les goulets d'étranglement.
Suivi multi-fournisseurs IA
Comptage des requêtes, des tokens et de la santé d'instance par fournisseur : visibilité et maîtrise des coûts.
Regroupement des erreurs
Les erreurs sont regroupées automatiquement par cause, pour diagnostiquer vite plutôt que de noyer l'opérateur sous les logs.
Tout le pipeline DSPM, chez vous ou en cloud managé
Téléchargez le scanner en on-premise ou optez pour l'offre de cloud managé, branchez une première source et obtenez un rapport d'audit complet : découverte, détection, classification et preuves.
