Ik bouw en test lokale AI.
Artikelen over AI-software en taalmodellen
Ik ben Django de Vreng. Ik bouw lokale AI-systemen, draai open modellen op de DGX Spark en schrijf hier over mijn werk. Bij de metingen deel ik de testinstellingen en leg ik uit wat de resultaten betekenen.
- 38
- Modelprofielen
- 10
- Verschillende tests
- 380
- Meetresultaten
- 128 GB
- Geheugen in mijn DGX Spark
Gemma-4 op de DGX Spark: NVFP4 vergeleken met BF16
Deze vijf tests vergelijken de decode-snelheid per gebruiker bij tien gelijktijdige verzoeken. De balken tonen het procentuele verschil van NVFP4 ten opzichte van BF16, berekend uit de gemiddelden in de Arena.
Dit vergelijkt twee configuraties, met verschillende model- en kernelinstellingen. De metingen zeggen niets over de kwaliteit van de antwoorden.
Chat: 1024 tokens invoer en 1024 uitvoer, c=10. BF16: vLLM v0.26.0. NVFP4: vLLM v0.26.0.
Bekijk beide profielen →Verschil in decode-snelheid
Alle balken: 0–125% verschil. De lengte toont de grootte van het verschil; + is sneller, − is langzamer. Een streepje betekent dat een vergelijkbare meting ontbreekt.
Wat kun je lokaal draaien, en wat heb je daarvoor nodig?
Vergelijk taalmodellen
Bekijk de snelheid en het geheugengebruik van modellen op mijn DGX Spark. De testinstellingen staan bij de resultaten.
Vergelijk modellen DGX SparkZelf modellen draaien
Lees hoe ik vLLM instel, modellen in het geheugen laat passen en test wat er gebeurt bij meerdere gelijktijdige verzoeken.
Open de DGX Spark-gids Lokale AIWanneer kies je voor lokaal?
Wat betekent lokaal draaien voor je kosten, gegevens en beheer? Ik vergelijk het met modellen via een clouddienst.
Open de beslisgids-
18-08-26·Build-logs001Build-logs
Mijn blog leesbaar maken voor AI-agents
Ik breidde de Markdown-routes van mijn blog uit met een index voor alle talen, consistente sitemapdatums en controles op de gebouwde site.
-
23-06-26·On-prem AI002On-prem AI
Gemma-4 v23 op de DGX Spark
Gemma-4 op de DGX Spark met vLLM v0.23.0. Ik vergelijk BF16, NVFP4 en MTP op uitvoersnelheid en wachttijd, ook bij grote context en piekbelasting.
-
22-05-26·On-prem AI003On-prem AI
De drie getallen achter een snelle DGX Spark
Decode, prefill en wachtrijen bepalen samen hoe snel een lokaal model reageert. Ik leg uit wat mijn DGX Spark-tests over elk van die onderdelen laten zien.
-
05-05-26·Reflecties004Reflecties
Waarom deze blog en arena bestaan
Waarom ik mijn tests met lokale modellen publiceer. De Arena bevat de metingen; in de blog beschrijf ik de instellingen, problemen en keuzes erachter.
-
03-05-26·On-prem AI005On-prem AI
Gemma-4 op de DGX Spark: NVFP4 vs BF16
Gemma-4 in BF16 en NVFP4, getest met dezelfde negen benchmarks. NVFP4 levert 22 tot 92 procent meer decode-tokens per seconde; bij piekbelasting stijgt de verwerkte verzoekfrequentie met 69 procent.
Ik ben Django.
Ik bouw aan de laag tussen taalmodellen en echt werk: agents, MCP-servers, lokale modellen en on-prem AI. Daarmee kunnen taalmodellen documenten ophalen en andere software gebruiken. Ik werk ook aan de foutafhandeling: wat gebeurt er bijvoorbeeld als een tool niet reageert?
Hier schrijf ik over die projecten en mijn tests op de DGX Spark. Ik leg uit welke keuzes ik maak en welke problemen ik tegenkom. Veel artikelen komen voort uit mijn werk bij Kamoo. Dit is mijn persoonlijke blog.
Meer over mij →