De ineenstorting van de kosten van AI-inferentie

De kosten om een AI-model te draaien op een kwaliteit gelijkwaardig aan GPT-3.5 daalden van ongeveer 20 USD per miljoen tokens eind 2022 tot ruwweg 0,07 USD per miljoen tokens tegen oktober 2024 – een meer dan 280-voudige reductie in ongeveer 18 maanden. Capabele AI is dramatisch goedkoper geworden om in te zetten.

20 $/M tokensNov. 20220.07 $/M tokensOkt. 2024
Kosten om een model op GPT-3.5-niveau te bevragen, USD per miljoen tokens (Stanford AI Index 2025).

Source: Stanford HAI — AI Index 2025: State of AI in 10 Charts (2025)

What it means

Een 280-voudige daling van de kosten van capabele AI in minder dan twee jaar is de reden waarom toepassingen die in 2023 onrendabel waren – het analyseren van elk onderhoudslogboek, elke sensorstroom, elk kwaliteitsbeeld – nu betaalbaar zijn om continu te draaien. Voor een exploitant luidt de praktische boodschap dat de budgetbarrière voor het toepassen van AI in de hele bedrijfsvoering grotendeels is verdwenen.

Context

De Stanford AI Index volgt de prijs om een vaste kwaliteitsdrempel te bereiken (ongeveer 64,8% op de MMLU-benchmark) in plaats van de prijs van één afzonderlijk genoemd model. Afhankelijk van de taak stelt het rapport vast dat de inferentieprijzen tussen de 9 en 900 keer per jaar dalen. Omdat de maatstaf de kwaliteit constant houdt terwijl hardware en modellen verbeteren, vangt hij echte economische winst op in plaats van louter korting.

Related charts

Related topics

All industrial data & charts →