Wer in einer Anwendung tausende Dokumente sortieren, Daten aus Texten ziehen oder Anfragen an spezialisierte Agenten verteilen lässt, braucht nicht für jeden Schritt ein großes Sprachmodell. Anthropic hat am 7. Oktober Claude Haiku 5.5 vorgestellt. Das neue Modell richtet sich an solche häufigen, zeitkritischen Aufgaben. Es ist über die Claude-API unter claude-haiku-5-5 erreichbar; Anthropic nennt außerdem Amazon Web Services, Google Cloud und Microsoft Azure als verfügbare Plattformen.
Der wesentliche Unterschied zum bisherigen Haiku 4.5 liegt nicht allein im niedrigeren Listenpreis. Haiku 5.5 kann seine Rechenarbeit mit adaptivem Denken an die Aufgabe anpassen. Entwickler steuern über den Effort-Parameter, wie viel Aufwand das Modell betreiben soll: Bei einer einfachen Klassifikation lässt sich die Antwort schneller und günstiger erzeugen, während schwierige Anfragen mehr Rechenzeit erhalten können. Die Modelldokumentation nennt ein Kontextfenster von einer Million Token und höchstens 128.000 Ausgabetoken. Ein großes Fenster ist für lange Eingaben nützlich, aber gerade dann wird die Preisstaffel wichtig.
Die Grenze bei 100.000 Token
Für Prompts mit bis zu 100.000 Token verlangt Anthropic laut seiner Preistabelle 0,10 US-Dollar je Million Eingabetoken und 0,50 US-Dollar je Million Ausgabetoken. Überschreitet ein Prompt diese Grenze, gelten 0,50 beziehungsweise 2,50 US-Dollar. Auch das Lesen eines zwischengespeicherten Prompts kostet dann statt 0,01 US-Dollar 0,05 US-Dollar je Million Token. Der günstige Einstiegspreis lässt sich deshalb nicht pauschal auf Anwendungen übertragen, die regelmäßig lange Akten oder große Codebestände in einen einzigen Prompt laden.
Hinzu kommt ein weniger sichtbarer Unterschied: Haiku 5.5 verwendet laut Anthropics Modelldokumentation einen neueren Tokenizer. Derselbe Text zählt demnach ungefähr 30 Prozent mehr Token als bei Haiku 4.5. Wer seine Kosten nur anhand der alten Tokenzahlen hochrechnet, unterschätzt möglicherweise die tatsächliche Rechnung und die Zahl der Anfragen jenseits der Preisgrenze. Anthropic beziffert die durchschnittliche Ersparnis gegenüber Haiku 4.5 auf rund 75 Prozent; dieser Wert berücksichtigt nach eigenen Angaben auch den geänderten Tokenverbrauch pro Aufgabe. Für einen konkreten Dienst entscheiden jedoch Eingabelänge, Ausgabeumfang, Cache-Nutzung und gewählte Rechenstufe über die Kosten.
Mehr Können ist nicht gleich bessere Wahl für jede Aufgabe
Anthropic berichtet für Haiku 5.5 deutliche Fortschritte bei der Bedienung von Computeroberflächen: Auf einer Offline-Teilmenge von OSWorld 2.1 erreicht es bei maximalem Aufwand 72,4 Prozent, gegenüber 15,7 Prozent für Haiku 4.5. Bei agentischen Coding-Aufgaben im Terminal-Bench 4.0 nennt Anthropic dagegen 39,2 Prozent für Haiku 5.5 und 70,6 Prozent für Sonnet 5.5. Die Zahlen stammen aus den veröffentlichten Evaluationen des Herstellers und gelten für die dort beschriebenen Testbedingungen. Sie illustrieren vor allem, warum ein günstiges Modell für klar begrenzte Teilschritte attraktiv sein kann, während ein schwieriger, mehrstufiger Programmierauftrag weiterhin ein stärkeres Modell verlangt.
Für Teams mit Agenten-Workflows bietet sich daher eine Aufteilung an: Haiku übernimmt etwa das Sichten, Extrahieren und Weiterleiten; Sonnet oder Opus bearbeiten die komplexeren Entscheidungen. Damit das wirtschaftlich funktioniert, sollten Teams nicht nur den Preis pro Token, sondern auch Fehlerraten, Wiederholungen und Gesamtkosten eines abgeschlossenen Vorgangs messen. Als zusätzliche Änderung senkt Anthropic den Preis für Cache-Lesezugriffe bei Sonnet 5.5 von 0,20 auf 0,10 US-Dollar je Million Token. Das kann die Rechnung für einen Agenten verändern, der denselben umfangreichen Kontext häufig erneut verwendet.
Umsteigen statt nur die Modellkennung austauschen
Bestehende Integrationen sollten den Wechsel von Haiku 4.5 gesondert testen. Der Migrationsleitfaden fordert unter anderem, Prompts neu zu zählen, bisherige feste Budgets für den Denkmodus auf adaptives Denken umzustellen und die Sampling-Parameter temperature, top_p und top_k zu entfernen. Anwendungen, die den ersten Antwortblock stets als eigentliche Antwort behandeln, müssen Blöcke nach ihrem Typ auswerten. Auch Ablehnungen mit stop_reason: "refusal" gehören in die Fehlerbehandlung. Für Kunden mit einer Priority-Tier-Zusage auf Haiku 4.5 ist besonders wichtig, dass Haiku 5.5 laut Leitfaden diesen Tier nicht unterstützt; sie müssen ihre Kapazitätsplanung getrennt klären.
Fazit
Haiku 5.5 macht schnelle, wiederkehrende Modellaufrufe für Entwickler interessanter und gibt ihnen mit dem einstellbaren Aufwand eine zusätzliche Stellschraube. Ob sich der Wechsel lohnt, zeigt aber erst ein Test mit den eigenen Prompts: Der neue Tokenizer, die Preisgrenze bei langen Eingaben und Änderungen an der API können den Vorteil des niedrigen Listenpreises im Einzelfall verkleinern. Für komplexe Agentenaufgaben bleibt zudem entscheidend, ob ein günstiger Teilschritt die Arbeit zuverlässig erledigt oder später teure Korrekturen auslöst.