L’IA locale : quand est-ce utile ?

Je fais tourner des modèles sur un DGX Spark. Je veux savoir lesquels restent utilisables quand les documents s’allongent et que plusieurs personnes posent des questions en même temps.

Mis à jour le 14 septembre 2026

Qu’est-ce qui tourne en local ?

Sur cette page, l’IA locale désigne surtout les modèles de langage que vous exécutez vous-même. La reconnaissance vocale et l’analyse d’images peuvent aussi fonctionner localement, mais je ne les teste pas ici.

Le modèle tourne sur votre ordinateur ou votre serveur. Vous pouvez aussi y garder les documents qu’il consulte et le traitement des questions. Il peut s’agir d’une station de travail, d’un serveur au bureau ou de votre propre cluster.

Cela ne veut pas dire que tout fonctionne hors ligne. Une intégration, un journal ou une sauvegarde peut encore envoyer des données ailleurs. Vérifiez aussi les outils autour du modèle, les accès et la destination des données.

Où fonctionne le système, et qui le gère ?

Sur site signifie que l’application fonctionne sur l’infrastructure de votre organisation. Un cloud privé est un environnement isolé, éventuellement géré par un fournisseur. Un hébergement européen indique une localisation, sans établir à lui seul qui dispose des accès ou du contrôle juridique.

Examinez toute la chaîne : modèle, stockage des documents, index de recherche, journaux et administration. Un modèle néerlandais peut tourner dans un cloud étranger. Un modèle étranger peut fonctionner sur votre propre serveur.

Pourquoi cela intéresse les organisations néerlandaises

Les cabinets comptables, les communes et les hôpitaux détiennent des connaissances dans des documents qui ne peuvent pas être librement partagés. L’IA peut aider à retrouver ces informations ou à préparer un brouillon. Un traitement local donne davantage de contrôle sur les accès et l’environnement de traitement. La protection réelle dépend de la mise en œuvre.

Je souhaite rendre cette expertise confidentielle accessible aux collaborateurs autorisés. Chaque bureau n’a pas besoin d’acheter son propre serveur. Un environnement géré en commun est aussi une option, si les responsabilités, les accès et les possibilités de changer de prestataire sont bien définis.

TNO cite l’autonomie numérique, la transparence et la langue et le contexte néerlandais parmi les principes de GPT-NL. Cela contribue à développer les compétences et les alternatives aux fournisseurs. Cela ne prouve pas qu’un modèle local maîtrise mieux le néerlandais, coûte moins cher ou est plus sûr. Ces points se vérifient pour chaque application.

TNO : GPT-NL et autonomie numérique

Dans quels cas je le choisirais

L’IA locale devient intéressante pour des tâches récurrentes, des documents qui doivent rester chez vous ou une version de modèle à conserver. Il faut toutefois un modèle assez bon pour le travail et quelqu’un pour entretenir l’installation.

Si vous cherchez encore quoi construire, prévoyez peu d’utilisation ou avez une demande irrégulière, une API cloud est souvent plus pratique. Vous n’avez pas à prévoir vous-même la capacité. La qualité, les prix et les limites dépendent du fournisseur.

Vous pouvez combiner les deux. Une tâche récurrente tourne en local ; une question plus difficile part vers un modèle externe. Définissez alors quelles données peuvent partir et comment vérifier le routage.

Différences pratiques entre local, cloud et hybride
Critère Local API cloud Hybride
Données Vous gérez le modèle et le traitement. Vérifiez aussi journaux et intégrations. Vous envoyez des données au fournisseur. Vérifiez les conditions de traitement. Définissez les données qui peuvent sortir pour chaque tâche.
Kwaliteit Testez si le modèle convient à votre tâche. Choisissez parmi les modèles proposés par le fournisseur. Utilisez différents modèles selon les tâches.
Capacité Votre matériel limite les traitements simultanés. Dépend des quotas, limites et disponibilités. Répartissez la charge avec des règles de repli explicites.
Entretien Vous gérez mises à jour, surveillance et reprise. Le fournisseur gère l’inférence ; votre application reste votre responsabilité. Entretenez l’installation locale et la connexion externe.
Kosten Achat, électricité, entretien et remplacement. Utilisation et service, y compris si la demande varie. Les deux catégories de coût, selon la répartition des tâches.

Par quoi pourrait-on commencer ?

Ces tâches peuvent servir de point de départ à un petit pilote. Je n’ai pas testé ces applications moi-même. Vérifiez pour chaque tâche si l’IA aide et si son exécution locale apporte quelque chose.

Par quoi pourrait-on commencer ?
Organisation Première application possible Pourquoi envisager le local ? Que faut-il vérifier ?
Experts-comptables Rassembler les informations d’un dossier client avec les références aux documents originaux. Davantage de contrôle sur le traitement des informations confidentielles. Vérifier les montants et les conclusions. Confier les calculs à un logiciel prévu à cet effet.
Juristes et avocats Comparer des versions de contrats ou préparer une chronologie du dossier. Maîtriser les documents confidentiels et les accès aux dossiers. Vérifier les textes de loi, la jurisprudence et les interprétations dans les sources originales.
Communes Rechercher dans les documents internes et préparer des projets de réponse. Maîtriser les services d’information et le traitement des données des habitants. Commencer par l’assistance, sans décisions autonomes sur les droits ou les prestations.
Hôpitaux Rechercher dans les protocoles internes ; ensuite, préparer des comptes rendus sous contrôle. Davantage de contrôle sur les informations sensibles et les intégrations. L’usage par les professionnels de santé nécessite une validation adaptée. Les décisions cliniques demandent une évaluation plus poussée que l’assistance administrative.

Ces exemples rejoignent l’importance du contrôle pour la NBA, de la responsabilité professionnelle pour la NOvA et de l’usage responsable dans les recommandations publiques. Nictiz étudie l’IA contre la charge administrative dans les soins. Ces sources justifient la prudence, pas la supériorité de l’hébergement local.

Une question dans un dossier comptable

Scénario illustratif, pas un cas client personnel ni un résultat mesuré.

Supposons qu’un collaborateur demande quelles conditions de paiement figurent dans le dossier du client A. L’application recherche d’abord dans les documents auxquels il a accès. L’index de recherche doit lui aussi respecter ces autorisations.

Le modèle reçoit les passages trouvés et prépare une réponse avec des références au document, à sa version et à la page. Le collaborateur ouvre les passages et vérifie la réponse. Les documents absents ou contradictoires doivent rester signalés.

J’évaluerais ce pilote avec des documents vérifiés à l’avance : le système retrouve-t-il le bon accord, cite-t-il la bonne source et exclut-il les informations des autres clients ? Il faut aussi poser des questions sans réponse dans le dossier. On peut ensuite mesurer si le temps de travail total, vérification et corrections comprises, diminue.

J’ai commencé à mesurer la vitesse et la capacité de mon matériel. Ces mesures se trouvent dans l’Arena. Elles aident à choisir le matériel, mais il faut vos propres exemples pour vérifier si un modèle répond à vos besoins.

Le graphique compare deux précisions d’un même modèle Gemma sur mon DGX Spark. La précision concerne le stockage et le traitement des nombres du modèle. Une précision réduite peut économiser de la mémoire et modifier la vitesse, mais aussi les réponses. Un token est un fragment de texte, pas nécessairement un mot entier. Il ne s’agit ni d’une comparaison avec un modèle cloud ni d’un test de qualité.

Un modèle en deux précisions

Gemma-4-26B-A4B-it sur un seul DGX Spark, dans une conversation. Les deux profils enregistrés côte à côte.

Paramètres du test : 1024 tokens d’entrée, 1024 tokens de sortie, 10 requêtes simultanées.

Vitesse de sortie par utilisateur

Plus de tokens par seconde signifie plus de vitesse.

BF16 10,55 tokens/s/utilisateur
NVFP4 21,1 tokens/s/utilisateur

Temps avant la première réponse

Moins de secondes signifie moins d’attente.

BF16 1,56 secondes
NVFP4 1,28 secondes

Ces mesures portent sur la vitesse, pas sur la qualité. Une autre précision peut modifier les réponses. Chaque exécution renvoie à sa source. Le tableau donne la moyenne ± l’écart-type.

BF16: · 3 exécutions Source NVFP4: · 3 exécutions Source
Toutes les mesures et sources

Mes mesures publiques sont réalisées sur un seul DGX Spark, dans les conditions indiquées. Elles portent sur la vitesse, pas sur la qualité. Une précision différente peut modifier les réponses. La source de chaque exécution contient les détails. Le tableau présente la moyenne ± l’écart-type.

Gemma-4-26B-A4B-it · DGX Spark
Charge Profil Vitesse de sortie par utilisateur Temps avant la première réponse Date de mesure Source
Une conversation BF16 10,55 ± 0,35 tokens/s/utilisateur 1,56 ± 0,53 secondes 2026-08-06 Source
Une conversation NVFP4 21,1 ± 1,12 tokens/s/utilisateur 1,28 ± 0,4 secondes 2026-08-06 Source
La recherche documentaire BF16 8,74 ± 0,68 tokens/s/utilisateur 8,8 ± 4,57 secondes 2026-08-06 Source
La recherche documentaire NVFP4 16,06 ± 2,1 tokens/s/utilisateur 8,17 ± 4,23 secondes 2026-08-06 Source
Des réponses longues BF16 11,36 ± 0,86 tokens/s/utilisateur 0,51 ± 0,05 secondes 2026-08-06 Source
Des réponses longues NVFP4 22,94 ± 0,76 tokens/s/utilisateur 0,38 ± 0,01 secondes 2026-08-06 Source

Ce que le local ne résout pas

Un modèle peut inventer des faits ou omettre une exception importante. Une référence facilite la vérification, mais ne garantit pas que la conclusion découle de la source.

Un document peut contenir des instructions destinées à manipuler le modèle. Traitez les textes récupérés comme des données, limitez les outils et testez ces attaques. Les droits d’accès, les mises à jour et la sécurité restent nécessaires sans API externe.

Le RGPD reste applicable. L’autorité néerlandaise de protection des données a explicitement rappelé que les mêmes exigences légales concernent les modèles exécutés localement. Examinez la finalité, la base légale, l’utilisation des données, leur conservation et la nécessité d’une AIPD avec les responsables de la protection des données et de la sécurité. Les règles applicables dépendent aussi de la fonction de l’application.

Davantage de contrôle demande aussi du travail. Une installation locale mal entretenue peut être moins sûre qu’un service bien configuré. Comptez l’entretien et la reprise dans les coûts, puis vérifiez que la disponibilité convient au travail prévu.

Autorité néerlandaise : les exigences légales concernent aussi l’usage local (lettre de 2023)

Ce que je vérifierais avant l’achat

  • Le modèle sait-il faire le travail ? Testez avec des exemples réels que vous avez le droit d’utiliser. Définissez les erreurs acceptables et qui évalue les réponses. Un benchmark général ne dit pas si vos documents sont bien traités.
  • Qu’est-ce qui sort du réseau ? Suivez les documents, les questions et les réponses. Incluez les sources consultées, les journaux, les sauvegardes et l’administration. Un modèle local ne garantit pas à lui seul la confidentialité.
  • Qui s’occupe du fonctionnement ? Quelqu’un doit prendre en charge les mises à jour, les pannes et les changements de modèle. Testez aussi ce qui se passe quand la machine est saturée ou indisponible, et comment poursuivre le travail.
  • Combien allez-vous l’utiliser ? Comptez l’achat, l’électricité, l’entretien et le remplacement. Une machine souvent inactive peut coûter plus cher qu’une API. Un usage prévisible facilite le calcul.
  • Pourrez-vous changer de solution ? Conservez la configuration et vérifiez que vos données peuvent être transférées. Posséder le matériel peut encore vous rendre dépendant d’un modèle, d’un moteur ou d’un système maison.

Ce que j’ai étudié

Mes mesures publiques tournent sur un seul DGX Spark. Elles montrent ce qui se passe sur cette machine, dans les conditions décrites.

Pourquoi j’ai commencé à mesurer

Commencez par une tâche

Choisissez un problème à résoudre maintenant. Rassemblez des exemples, définissez des résultats acceptables et testez les documents longs et les questions simultanées. Examinez les erreurs et leur résolution en plus de la vitesse. Vous pourrez alors choisir entre local, cloud ou une combinaison et estimer le matériel nécessaire.

Voir les hypothèses de coût