On-prem AI.
taalmodellen op eigen hardware
Tests met lokale taalmodellen op de DGX Spark. Ik vergelijk geheugen en snelheid bij verschillende precisies en belastingen.
Abonneer · RSS-
23-06-26·On-prem AI001On-prem AI 7 min
Gemma-4 v23 op de DGX Spark
Gemma-4 op de DGX Spark met vLLM v0.23.0. Ik vergelijk BF16, NVFP4 en MTP op uitvoersnelheid en wachttijd, ook bij grote context en piekbelasting.
-
22-05-26·On-prem AI002On-prem AI 4 min
De drie getallen achter een snelle DGX Spark
Decode, prefill en wachtrijen bepalen samen hoe snel een lokaal model reageert. Ik leg uit wat mijn DGX Spark-tests over elk van die onderdelen laten zien.
-
03-05-26·On-prem AI003On-prem AI 13 min
Gemma-4 op de DGX Spark: NVFP4 vs BF16
Gemma-4 in BF16 en NVFP4, getest met dezelfde negen benchmarks. NVFP4 levert 22 tot 92 procent meer decode-tokens per seconde; bij piekbelasting stijgt de verwerkte verzoekfrequentie met 69 procent.
-
03-05-26·On-prem AI004On-prem AI 17 min
Nemotron-3 op de DGX Spark: BF16 vs FP8 vs NVFP4
Nemotron-3 in BF16, FP8 en NVFP4 op dezelfde DGX Spark. Ik vergelijk het geheugengebruik, de uitvoersnelheid en de wachttijd van de langzaamste verzoeken.
-
01-05-26·On-prem AI005On-prem AI 26 min
Gemma-4 op de DGX Spark: de prijs van context
Negen benchmarks van Gemma-4-26B-A4B-it op de DGX Spark met llama-benchy en vLLM. Met uitvoersnelheid, promptverwerking en wachttijden bij verschillende belastingen.
-
01-05-26·On-prem AI006On-prem AI 7 min
Ik zette een 24/7 assistent op een Raspberry Pi
OpenClaw op een Raspberry Pi 5, met Slack als interface en GPT-5.5 als model. Ik laat de agent voorstellen voorbereiden en beoordeel zelf wat wordt gepubliceerd.
-
01-05-26·On-prem AI007On-prem AI 7 min
Wat quantization werd na drie benchmarkrondes
Een praktische terugblik op quantization op de DGX Spark: wat BF16, FP8 en NVFP4 doen met geheugen, snelheid en tail-latency, na drie benchmarkrondes met vLLM.