1. Blick ins Heft c’t 20/2026: KI-Kosten drücken und Zeit sparen

Hallo aus Hannover,

Weiterlesen nach der Anzeige

wer ChatGPT recherchieren lässt oder mit Claude über Problemen brütet, bezahlt nach Tokenverbrauch. Dabei eröffnen sich unzählige Möglichkeiten, Geld zu sparen oder zu verbrennen. Relativ offensichtlich ergibt sich aus den Preislisten der Hersteller, dass deren jeweils mächtigste Modellversion pro Token teurer kommt als die einfacheren, älteren Modelle. Doch der Teufel steckt wie immer im Detail und Kostentreiber verbergen sich teilweise tief in der Funktionsweise der Sprach- und multimodalen Modelle. Wer nicht aufpasst und KI-Projekte allzu hemdsärmelig angeht, kann locker über Nacht ein paar tausend Euro an Budget verbrennen.

Meine Kollegen Carolin Riethmüller, Robin Ahrens, Jo Bager, Hartmut Gieselmann und ich haben deshalb Preislisten studiert, Vergleichsrechner konsultiert, uns in die Mechanismen der Tokenkalkulation vertieft – und geben praktische Tipps, die Kosten sparen. Vergleichsweise günstig sind die chinesischen Open-Weights-Modelle wie Qwen, Kimi und Deepseek. In Benchmarks sind sie den Frontier-KIs von OpenAI und Anthropic bereits hart auf den Fersen. Doch was taugen sie in der Praxis? Auch das haben wir getestet.

KI: Kosten drücken und Zeit sparen

Ob OpenAI, Anthropic oder die deutlich günstigere Konkurrenz aus China: Sie alle lassen sich die Dienste ihrer Chatbots und APIs mittlerweile nach der Datenmenge bezahlen, die die Modelle verarbeiten müssen, um einen Frage zu beantworten oder ein komplexeres Problem zu lösen. Die Maßeinheit sind Token (bei Texten entspricht ein Token meist einem Wort, Wortfragment oder Satzzeichen), und Ausgabe- sowie Reasoning-Token sind ungefähr sechsmal so teuer wie die, die man einspeist. Token, die durch ein High-End-Modell fließen, lassen sich die Firmen ebenfalls höher vergüten. Das kennt man von Dienstleistern aus Fleisch und Blut; der Chef verlangt schließlich auch einen höheren Stundenlohn als der Lehrling.

Doch wer in der Welt der KI-Dienste nur auf die Preisschilder schaut, landet schnell in einer Kostenfalle. Mancher Hersteller ruft sehr günstige Preise pro einer Million Token auf, betreibt dann aber einen unverhältnismäßig hohen Aufwand, um einfache Probleme zu lösen. Praktischerweise gibt es Analysedienste, die anhand von Benchmarks messen, wie hoch der Preis für die Lösung konkreter Aufgaben im Schnitt ausfällt. In deren Berechnungen relativiert sich mancher vermeintlich großer Preisvorteil. Mein Kollege Hartmut Gieselmann hat die Details hinter den Preismodellen recherchiert und gibt auch Einblicke in die Betriebskosten der Anbieter – und unter welchen Umständen sich der Betrieb eines eigenen Modells lohnt.

Unabhängig davon, für welchen Dienstleister man sich entscheidet, sollte man sich sich grob damit auseinandersetzen, an welcher Stelle wie viele Token anfallen. Offensichtlich ist: Prompts und Inhalte, die man eingibt, zählen zu den Input-Token und die Antworten summieren sich zu den Output-Token. Doch hinter den Kulissen initiieren die Modelle mitunter sehr aufwendige Reasoning-Schleifen, um menschliches Denken zu simulieren, etwa wenn man sie mit einer umfangreichen Recherche beauftragt oder ein komplexes Problem diskutiert. A propos diskutieren: Längere Chats über umfangreiche Dokumentsammlungen lassen den Verbrauch an Input-Token in die Höhe schießen. Das liegt daran, dass sich die Chatbots den Verlauf nicht grundsätzlich merken und bei jeder Nachfrage die komplette Historie neu einspeisen. Wer sich dessen bewusst ist, kann vorbeugen, indem er Prompts geschickt formuliert und dadurch zumindest temporäres Caching aktiviert.

Auf Grundlage solcher Erkenntnisse geben Carolin Riehtmüller und Jo Bager konkrete Tipps, wie Sie zum einen den Tokenverbrauch reduzieren und zum anderen die für Ihre Zwecke günstigsten Tarife finden. Auch China-Modelle erwiesen sich in unseren Tests als konkurrenzfähige Alternative, etwa um Daten auszuwerten oder Grafiken zu erstellen. Doch nicht jedes erfüllt jede Aufgabe zur Zufriedenheit unserer Tester – und beim Coding setzte sich eines der Frontier-Modelle ganz klar ab.

Weiterlesen nach der Anzeige

(Bild: Martina Bruns / KI / heise medien)

Auch das noch!

Der Bund und einige Länder planen, ihre Polizeigesetze zu ändern, und damit die Befugnisse der Polizei zur Überwachung massiv auszuweiten. Unter anderem wollen sie biometrische Echtzeitüberwachung und Verhaltensscanner an öffentlichen Plätzen erlauben. Sollte der Bundestag nach der Sommerpause das Gesetz mit einer gültigen Mehrheit beschließen, muss anschließend noch der Bundesrat zustimmen; der hatte im Jahr 2021 eine damals geplante Neufassung gekippt.

Die Bundespolizei soll Live-Gesichtserkennung in besonderen Gefahrenlagen auf richterliche Anordnung einsetzen dürfen. Das betrifft Orte wie Bahnhöfe, Flughäfen oder Grenzgebiete, die in ihren Zuständigkeitsbereich fallen. Vorbild ist das Bundesland Hessen, das bereits 2024 eine entsprechende Rechtsgrundlage geschaffen hat. Zudem soll es möglich werden, mithilfe von Videotechnik Bewegungsmuster zu identifizieren, die auf die Begehung einer Straftat hindeuten. In Mannheim, Berlin und Hamburg laufen bereits Pilotprojekte mit Technik des Fraunhofer IOSB beziehungsweise Adesso SE.

Auf Länderebene plant Niedersachsen eine besonders umfangreiche Polizeigesetznovelle, die Echtzeit-Gesichtserkennung, Verhaltensanalysen und den Abgleich biometrischer Daten mit Informationen aus dem Netz erlauben soll. Weil der Entwurf an mehreren Stellen europäisches Recht, Bundesgesetze und die Rechtsprechung des Verfassungsgerichts berührt, dürften sich die Beratungen darüber Experten zufolge noch einige Monate hinziehen. Weitere Bundesländer wie etwa Sachsen haben ähnlich gelagerte Gesetze bereits beschlossen oder setzen entsprechende Techniken bereits unter bestimmten Bedingungen ein, wie etwa Bayern die Kameraüberwachung bei "drohender Gefahr".

Bislang war insbesondere dem Einsatz von Datenanalyseplattformen wie etwa der von Palantir enge Grenzen gesetzt, unter anderem weil die Polizeigesetze die damit möglichen umfangreichen Verknüpfungen von Datenbanken nicht abdeckten. Kritiker befürchten nun, dass die überarbeiteten Gesetze die rechtliche Basis für den Aus- und Aufbau einer Überwachungsinfrastruktur schaffen.

Meine persönlichen Highlights

Knappe Speicherchips treiben die PC-Preise nach oben. Wir wagen das Experiment und arbeiten zwei Wochen lang mit Billigrechnern für unter 250 Euro.

Es muss nicht immer High-End sein, wenn es um ein neues Smartphone geht. Fünf Smartphones von Google, Motorola, Nothing, Samsung und Xiaomi zeigen, was die Mittelklasse drauf hat.

Das Netzteil ist der Maschinenraum jedes PCs. Wir haben sieben ATX-Netzteile bis 750 Watt getestet und dabei besonders auf Wirkungsgrad und Störsicherheit geachtet.

Qubits aus neutralen Atomen galten noch vor wenigen Jahren als Nischentechnologie, nun setzt sogar Google darauf. Wie funktioniert die Technik und wie unterscheidet sie sich von anderen Architekturen wie den bekannteren supraleitenden Qubits? Wir sind zu Besuch beim Start-up planqc, das ganz vorn mitspielt – obwohl es noch kein Gerät ausgeliefert hat.

Einmal pusten und schon weiß der Sportler mit einem Gerät der ETH Zürich, ob sein Fettstoffwechsel bereits angesprungen ist. Weitere Forschungsprojekte untersuchen, was der Atem noch verrät über den Stoffwechsel, akute Erkrankungen oder Krebs in frühen Stadien.

Pakete im Internet können sich durch Fehler oder Angriffe auf Abwege begeben. Die Mechanismen einer wenig bekannten Public-Key-Infrastruktur schützen davor.

Für Bildschirmfotos und -videos brauchen Sie bei Windows 11 in vielen Fällen kein Extrawerkzeug mehr. Das bordeigene Snipping Tool erzeugt nicht nur Bilder, Videos und GIFs, sondern kann auch Text erkennen und ist erstaunlich flexibel einstellbar.

Valves Steam Machine ist da und enttäuscht. Unser ausgewogenerer flüsterleiser Gegenvorschlag liefert mehr Performance und Speicherplatz.

Die Vereinsverwaltung in der Low-Code-Datenbank Grist aus dem ersten Teil dieser Artikelserie wird erwachsen. Das Gerüst aus verknüpften Tabellen erweitert sich mit Formeln und verschiedenen Dashboards zu einer echten Datenbankanwendung.

Intel speckt die Wildcat-Lake-CPUs gegenüber Core Ultra 300 „Panther Lake“ spürbar ab. Wo der Hersteller genau den Rotstift ansetzt, zeigt unsere Analyse.

(Bild: Intel)

Aus der Redaktion

Wahrlich im Rausch der Bits befand sich mein Kollege Florian Müssig anlässlich der hochsommerlichen Fachkonferenz Hot Chips im Silicon Valley. Hier geht es nicht nur um die großen Trends wie die unvermeidlichen KI-Beschleuniger, sondern das gesamte Spektrum der Branche: IBM brachte zum Beispiel die nächste Generation seiner Prozessoren für die Mainframes der z-Serie mit, auf denen das Gros aller klassischen Bank- und Kreditkartentransaktionen läuft. Der Neue beherrscht zusätzlich zu den Befehlssätzen der hauseigenen z/Architecture auch ARM-Befehle.

Auch von den Speicherherstellern gibt es neue Konzepte: Weil die modernen KI-Modelle enorm viel Speicher benötigen, rücken diese immer weiter von den Rechenwerken weg. Deshalb entwickeln Firmen und Forscher In-Memory- beziehungsweise Near-Memory-Techniken, um die Daten möglichst speichernah vorzuverarbeiten: also dort, wo die Latenzen geringer und die Datentransferraten höher sind.

Als Publikumsmagnet auf der diesjährigen Hot Chips erwiesen sich auch die Vorträge der Hyperscaler, die eigene KI-Beschleuniger bauen und ihre neuesten Modelle präsentierten: Microsoft stellte seinen Maia-200 vor, Meta den MTIA-400 und Google die mittlerweile achte TPU-Generation. Nicht zuletzt wegen solcher Einblicke lockt die Hot Chips zahlreiche Koryphäen an; unter anderem erspähten die Kollegen Ex-Intel-CEO Pat Gelsinger, den Transmeta-Gründer David Ditzel sowie die emeritierten Professoren John Hennessy und David Patterson (siehe Bild).

(Bild: Florian Müssig / heise medien)

Immer in c't:

Mehr anzeigenWeniger anzeigen

(atr)

Dieser Link ist leider nicht mehr gültig.

Links zu verschenkten Artikeln werden ungültig, wenn diese älter als 7 Tage sind oder zu oft aufgerufen wurden.


Sie benötigen ein heise+ Paket, um diesen Artikel zu lesen. Jetzt eine Woche unverbindlich testen – ohne Verpflichtung!