Ein großes Sprachmodell effizient zu trainieren, hängt nicht allein von der Zahl seiner Parameter ab. Bei einem Mixture-of-Experts-Modell (MoE) wird für jedes Token nur ein Teil des Netzes aktiviert. Das spart Rechenarbeit, verlangt aber, dass GPUs die passenden Daten schnell zwischen den spezialisierten Teilnetzen austauschen. Genau für diese Arbeit hat Ai2 am 1. Oktober Olmo-core 3 vorgestellt: eine neue Version seiner offenen Trainingsinfrastruktur für große MoE-Modelle. Parallel dazu erschien die Version 3.0.0 des öffentlichen Repositories.[1][3]
Die Experten bleiben auf den GPUs
Ai2 ändert vor allem, wie das Training die Experten über die Hardware verteilt. Die frühere MoE-Implementierung in Olmo-core verwendete Fully Sharded Data Parallelism (FSDP) und holte für kleine Datenchargen wiederholt Modellgewichte zusammen. Der neue Trainingsstack basiert auf Distributed Data Parallelism (DDP): Die Experten bleiben auf den GPUs, während die zu verarbeitenden Token zu ihnen geschickt werden. So entfällt ein Teil der wiederholten Gewichtsübertragung. Dass MoE-Training damit grundsätzlich günstig wird, folgt daraus nicht: Auch Datenverkehr, Optimierungszustand und sämtliche Modellgewichte benötigen Ressourcen.[1]
Bei großen Clustern greifen mehrere Verfahren ineinander. Expert Parallelism verteilt die Experten auf verschiedene GPUs; Pipeline Parallelism verteilt aufeinanderfolgende Modellschichten. Ein verteilter Optimierer teilt zudem den Speicher für die beim Training benötigten Zustände auf. Für die eigentliche Expertenberechnung bündelt der Stack viele kleine Matrixoperationen zu größeren Aufrufen. Die Routing-Metadaten bleiben auf den GPUs, statt für jeden Schritt zur CPU zurückzukehren. Für Entwickler, die eigene MoE-Modelle trainieren, ist gerade dieses Zusammenspiel wichtig: Eine schnellere einzelne Rechenoperation nützt wenig, wenn der Datenverkehr den Gewinn wieder aufzehrt.[1]
Was die Messungen zeigen – und was nicht
In einem vorläufigen Test mit acht Nvidia-B300-GPUs verarbeitete ein MoE mit 47 Milliarden Gesamtparametern laut Ai2 mit dem neuen Stack 52.000 Token pro Sekunde und GPU. Die ältere Implementierung kam im selben Vergleich auf 19.400; das entspricht laut Ai2 etwa dem 2,7-Fachen des Durchsatzes. Ein weiterer Versuch vergrößerte den Expertenpool von acht auf 128 Experten, während pro Token weiterhin vier ausgewählt wurden. Die Gesamtkapazität stieg dabei von 4,6 auf 47 Milliarden Parameter, der gemessene Trainingsdurchsatz sank um weniger als fünf Prozent. Diese Ergebnisse vergleichen Konfigurationen und Implementierungen aus Ai2s eigenen Tests, nicht die Qualität fertig trainierter Modelle oder die Kosten beliebiger GPU-Cluster.[1]
Ai2 erprobte auch MXFP8, ein Zahlenformat mit geringerer Präzision. In einem kontrollierten Test auf vier B300-GPUs und bei gleichmäßig verteilter Arbeit unter den Experten lag der Durchsatz rund 21 Prozent über der BF16-Baseline; der maximale aktive Speicherbedarf fiel von 103 auf 95 GiB. Ob sich dieser Vorteil in einem anderen Training wiederholt, hängt unter anderem von der Expertenverteilung und vom Aufwand für Formatumwandlungen ab.[1]
Besonders große Konfigurationen sind bislang vor allem Skalierungstests: Ai2 maß ein Modell mit 1,2 Billionen Gesamtparametern und 58,36 Milliarden aktiven Parametern pro Token auf 512 B300-GPUs. Dabei setzte das Team zufälliges Routing ein, um die Systemleistung zu messen. Einen Versuch mit 2,38 Billionen Parametern beschreibt Ai2 ausdrücklich als kurzen Kapazitätstest, nicht als vollständigen Trainingslauf. Aus diesen Zahlen lässt sich deshalb weder die spätere Modellgüte noch ein dauerhaft erzielbarer Durchsatz für produktive Trainingsläufe ablesen.[1]
Warum der offene Stack zählt
Das Repository stellt Olmo-core öffentlich unter der Apache-2.0-Lizenz bereit. Damit können Forschungsteams die Implementierung untersuchen und eigene Trainingsversuche darauf aufbauen. Die Installationshinweise nennen PyTorch sowie zusätzliche, teils optionale Komponenten für bestimmte Funktionen; die bereitgestellten Container können außerdem von der eigenen Hardware- und Treiberumgebung abweichen. Ein lauffähiger Benchmark auf B300-GPUs ersetzt daher keinen Test auf dem eigenen Cluster.[2]
Olmo-core 3 ist nicht die Veröffentlichung eines neuen, fertig trainierten Olmo-Modells. Ai2 beschreibt den Stack vielmehr als Grundlage für eine kommende Olmo-Generation mit MoE-Architektur. Für Teams, die Trainingssysteme entwickeln, bietet die Freigabe einen nachvollziehbaren Blick auf Routing, Parallelisierung und Präzisionsformate. Wer dagegen lediglich ein Modell einsetzen möchte, bekommt mit diesem Release noch keine neue Modellqualität geliefert. Die eigentliche Frage bleibt, wie sich die Systemvorteile in vollständigen Trainingsläufen und bei der Qualität der daraus entstehenden Modelle niederschlagen.[1]
Quellen
[1] Ai2: Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs, 1. Oktober 2026.
[2] Ai2: Olmo-core, GitHub-Repository, abgerufen am 2. Oktober 2026.
[3] Ai2: Release v3.0.0, 1. Oktober 2026.