Je développe et teste l’IA locale.
Articles sur les logiciels d’IA et les modèles de langage
Je suis Django de Vreng. Je construis des systèmes d'IA locale, fais tourner des modèles ouverts sur le DGX Spark et je raconte mon travail ici. Je partage les paramètres de test avec mes mesures et j’explique les résultats.
- 38
- Profils de modèles
- 10
- Tests différents
- 380
- Mesures
- 128 GB
- Mémoire de mon DGX Spark
Gemma-4 sur le DGX Spark : NVFP4 comparé à BF16
Ces cinq tests comparent la vitesse de decode par utilisateur avec dix requêtes simultanées. Les barres montrent l’écart en pourcentage de NVFP4 par rapport à BF16, calculé à partir des moyennes de l’Arena.
Cette comparaison porte sur deux configurations avec des paramètres de modèle et de kernel différents. Les mesures n’évaluent pas la qualité des réponses.
Chat : 1024 tokens d’entrée et 1024 de sortie, c=10. BF16: vLLM v0.26.0. NVFP4: vLLM v0.26.0.
Voir les deux profils →Écart de vitesse de decode
Toutes les barres : 0–125% d’écart. La longueur indique l’amplitude ; + signifie plus rapide, − plus lent. Un tiret indique l’absence de mesure comparable.
Que peut-on faire tourner localement, et avec quel matériel ?
Comparer les modèles de langage
Consultez la vitesse et l’utilisation de mémoire des modèles sur mon DGX Spark. Les paramètres de test accompagnent les résultats.
Comparer les modèles DGX SparkFaire tourner ses propres modèles
Découvrez comment je configure vLLM, fais tenir les modèles en mémoire et teste plusieurs requêtes simultanées.
Ouvrir le guide DGX Spark IA localeQuand choisir le local ?
Quelles conséquences pour les coûts, les données et la maintenance ? Je compare l’exécution locale aux modèles proposés par un service cloud.
Ouvrir le guide de décision-
18-08-26·Carnets de développement001Carnets de développement
Rendre mon blog lisible par les agents IA
J'ai ajouté des versions Markdown, un index pour agents et des contrôles de build. Pas pour une astuce GEO, mais pour rendre la source moins ambiguë.
-
23-06-26·IA sur site002IA sur site
Gemma-4 v23 sur le DGX Spark
Nouveaux runs vLLM v0.23.0 pour Gemma-4 sur DGX Spark : BF16, NVFP4 et MTP comparés sur decode, TTFT, tails et limites pratiques pour agents locaux.
-
22-05-26·IA sur site003IA sur site
Les trois chiffres d'une DGX Spark rapide
Decode, prefill et queueing : trois chiffres décident si une DGX Spark semble rapide sous une vraie charge, et ce sont eux que la plupart des tests oublient.
-
05-05-26·Réflexions004Réflexions
Pourquoi ce blog et cette arena existent
Je cherchais des chiffres concrets sur l'IA locale sur le DGX Spark, sans en trouver. Alors je les mesure moi-meme et je batis le blog et l'arena en etabli.
-
03-05-26·IA sur site005IA sur site
Gemma-4 sur la DGX Spark : NVFP4 vs BF16
Neuf benchmarks identiques, deux précisions. NVFP4 est 22 à 92 pour cent plus rapide par token, et la capacité grimpe de 69 pour cent aux heures de pointe.
Je suis Django.
Je construis la couche entre les modèles de langage et le travail réel : des agents, des serveurs MCP, des modèles locaux et de l’IA sur site. Ils permettent aux modèles de langage de récupérer des documents et d’utiliser d’autres logiciels. Je travaille aussi sur la gestion des erreurs : que se passe-t-il si un outil ne répond pas, par exemple ?
Je présente ici ces projets et mes tests sur le DGX Spark. J’explique mes choix et les difficultés rencontrées. Beaucoup d’articles proviennent de mon travail chez Kamoo. Ceci est mon blog personnel.
En savoir plus sur moi →