Een AI agent of taalmodel kun je op drie manieren laten draaien: volledig bij een cloudaanbieder, hybride of volledig lokaal. Voor de meeste MKB-bedrijven is hybride de beste keuze: je eigen logica, gegevens en koppelingen staan op je eigen server, en alleen het denkwerk gaat via een taalmodel in de cloud. Volledig lokaal is alleen nodig als gegevens het pand echt niet mogen verlaten.
Zodra je voorbij het experimenteren met ChatGPT bent en een AI agent wilt die zelfstandig werk doet, kom je bij deze vraag uit. Het antwoord bepaalt wat je maandelijks betaalt, hoe veilig je gegevens zijn en hoe afhankelijk je wordt van één leverancier. In dit artikel zetten we de opties naast elkaar, met de kosten en de valkuilen die je pas tegenkomt als het systeem echt draait.
Waar bestaat een AI agent uit?
Een AI agent is geen los programmaatje, maar een stapeling van vier onderdelen. Voor elk onderdeel bepaal je waar het draait:
- Het taalmodel: het deel dat tekst begrijpt en redeneert, zoals GPT, Claude, Gemini of een open-source model als Llama of Mistral.
- De aansturing: de logica die bepaalt welke stappen de agent zet en in welke volgorde.
- Het geheugen: een database met context, eerdere gesprekken en bedrijfskennis.
- De koppelingen: de verbindingen met je eigen systemen, zodat de agent echt iets kan doen, zoals een mail sturen of een lead in je CRM zetten.
Optie 1: alles bij een cloudaanbieder
De snelste start. Je bouwt je agent in de omgeving van bijvoorbeeld OpenAI of in een kant-en-klaar platform, en betaalt per gebruik. Het taalmodel reken je af per token: een stukje woord dat je verstuurt of terugkrijgt.
Voordelen: direct toegang tot de sterkste modellen, geen eigen hardware en opschalen gaat vanzelf.
Nadelen: je gegevens gaan naar een externe partij, je hebt weinig invloed op prijswijzigingen en je zit vast aan de keuzes van dat platform. Voor prototypes en taken zonder gevoelige gegevens prima. Zodra de agent diep in je bedrijfsprocessen zit, wordt het een risico.
Let op de AVG: kies waar mogelijk een Europese verwerkingslocatie. OpenAI biedt zakelijke klanten dataopslag in Europa, Microsoft en Amazon bieden taalmodellen aan vanuit Europese datacenters, en met Mistral heb je een Europese aanbieder.
Optie 2: hybride, de aanpak die wij meestal kiezen
Bij hybride hosting scheid je het denkwerk van de rest. De aansturing, het geheugen en de koppelingen draaien op een goed beveiligde server in een Europees datacenter, bijvoorbeeld met een automatiseringsplatform als n8n of met maatwerksoftware. Je bedrijfsregels, gegevens en toegangssleutels blijven daar. Alleen wat nodig is voor het denkwerk gaat, waar mogelijk zonder persoonsgegevens, naar een taalmodel in de cloud.
Het grote voordeel: jij houdt de regie. Verandert een aanbieder zijn prijzen of voorwaarden, dan zet je in je eigen omgeving de koppeling om naar een ander model. Je hoeft je systeem niet opnieuw te bouwen.
Optie 3: volledig lokaal
Soms mogen gegevens het pand of je eigen server echt niet verlaten. Denk aan zorg, advocatuur of werk onder strenge geheimhoudingsafspraken. Dan draai je ook het taalmodel zelf: een open-source model op eigen hardware of een afgeschermde server. Tools als Ollama en vLLM maken dat technisch haalbaar.
Voordelen: maximale controle, geen gegevens bij derden en geen kosten per token.
Nadelen: een taalmodel heeft vooral veel geheugen op de videokaart nodig (VRAM). Voor een model dat slim genoeg is voor serieus werk heb je krachtige, dure GPU's nodig. Een geschikte server huren kost al snel honderden tot duizenden euro's per maand, en onderhoud, beveiliging en updates liggen bij jou. Voor een bedrijf met twintig medewerkers schiet dat vaak zijn doel voorbij.
Hier kunnen we je mee helpen
AI AutomatiseringAI-systemen op maat: document-verwerking, lead-verrijking en custom workflows die je team uit het routine-werk halen.Bekijk dienst →
Maatwerk SoftwareCustom platforms, MVPs en interne systemen die precies passen bij hoe jij werkt. MVP-first, dan iteratief uitbouwen.Bekijk dienst →
BlogautomatiseringEen n8n-pipeline die SEO-blogs genereert in jouw stem: van topic research tot publicatie en Google indexing.Bekijk dienst →Wat kost het?
De kosten worden vaak verkeerd ingeschat, in beide richtingen:
- Via een API lijken de kosten laag: vaak een fractie van een cent per kort verzoek. Maar laat je dagelijks duizenden documenten samenvatten, dan loopt het snel op. Korte instructies, het hergebruiken van eerdere antwoorden en het juiste model per taak maken dan het verschil.
- Zelf hosten vraagt een investering vooraf of een vast bedrag per maand voor gehuurde GPU's, ongeacht hoeveel je het gebruikt.
- De server voor aansturing en geheugen is meestal het goedkoopste deel. Een agent die af en toe een mail verwerkt, draait op een kleine server. Een agent die continu grote hoeveelheden documenten doorzoekt, heeft meer nodig.
Voor de meeste MKB-bedrijven met 5 tot 50 medewerkers is de API-route binnen een hybride opzet financieel verreweg het logischst.
Van test naar productie: waar het misgaat
Een prototype op een laptop werkt prima met één gebruiker. De problemen beginnen als tien medewerkers of honderd klanten tegelijk iets vragen.
- Snelheid: een lokaal model moet vaak verkleind worden om snel genoeg te zijn (kwantisatie). Dat kost wat kwaliteit. Een interne assistent mag twee seconden nadenken, een klantgesprek niet.
- Vertraging tussen onderdelen: zet je database in hetzelfde datacenter als de aansturing, anders tikt elke stap aan.
- Volume: breng vooraf in kaart hoeveel verzoeken er per dag komen, zodat de kosten niet onverwacht oplopen.
Veiligheid: voorkom dat je agent ontspoort
Een taalmodel doet wat er in zijn invoer staat, ook als die invoer van een kwaadwillende komt. Neem deze maatregelen:
- Bescherm je tegen prompt injection: iemand kan via een contactformulier of chat proberen je agent andere instructies te geven. Houd systeeminstructies en gebruikersinvoer strikt gescheiden, en laat de agent niets doen wat hij niet mag.
- Geef zo min mogelijk rechten: een agent die leads leest, hoeft je CRM niet te kunnen leegmaken.
- Bewaar toegangssleutels veilig: nooit in de code, altijd in afgeschermde instellingen van je server.
- Stel limieten in: op hoeveel de agent per dag mag uitgeven of versturen.
- Log alles: wat ging erin en wat kwam eruit? Zonder logboek weet je niet waarom de agent iets verzon.
"Ik bouw liever een systeem dat direct voor je werkt, dan dat ik je een dik rapport verkoop over wat er eventueel mogelijk is."
— Jesse Scherpen, eigenaar SharpClicks
Welke optie past bij jou?
- Kies de cloud als je snel wilt testen en er geen gevoelige gegevens in het spel zijn.
- Kies hybride als de agent onderdeel wordt van je dagelijkse werk en je controle wilt over je gegevens en leveranciers. Voor de meeste MKB-bedrijven is dit het uitgangspunt.
- Kies lokaal als wetgeving of afspraken met klanten het versturen van gegevens echt uitsluiten, en je het budget voor hardware en beheer hebt.
Hoe wij dit aanpakken
Een taalmodel draaiend krijgen is de helft van het werk. De waarde zit in wat eromheen gebeurt. Een voorbeeld: er komt een uitgebreide aanvraag binnen per mail. Het systeem pakt de mail op, laat het taalmodel de kern eruit halen, zoals naam, budget en probleem, en zet dat netjes in je CRM. Je verkoper belt dezelfde dag, zonder iets over te typen. Hoe we dat voor ons eigen klantcontact bouwden, met gevoelige informatie op de eigen server, zie je in onze case over CRM-verwerking.
Welk taalmodel je daarvoor kiest en hoe je de uitkomst controleert, lees je in een AI-applicatie laten bouwen.
Conclusie
Waar je een AI agent laat draaien, is geen technisch detail. Het bepaalt je kosten, je veiligheid en je vrijheid om later van leverancier te wisselen. Begin in de cloud om te testen, bouw hybride zodra het echt wordt, en kies alleen voor volledig lokaal als het moet.
Wil je weten welke opzet bij jouw proces past? Plan een kennismaking. Meer over wat we bouwen lees je bij AI-automatisering.
