de.wedoany.com-Bericht: Vom 19. bis 20. Juli 2026 veröffentlichte der chinesische GPU-Hersteller Tianshu Zhixin auf der 2026 World Künstliche Intelligenz Conference (WAIC 2026) offiziell sein neues Flaggschiff-Produkt für allgemeine GPUs der nächsten Generation, den Tian'e 300.

Als erstes Produkt der neuen, selbst entwickelten Architektur von Tianshu Zhixin wurde der Tian'e 300 umfassend in den Bereichen Chip-Architektur, Schlüsseloperatoren, Systemerweiterung und Software-Ökosystem aufgerüstet. Ziel ist es, die Leistungseffizienz der gängigen Hopper-Architektur (Hopper-Lösung) zu erreichen und zu übertreffen, um Rechenleistung für die großflächige Anwendung von KI bereitzustellen.

Der Tian'e 300 basiert auf der SIMT-Allzweck-Rechenarchitektur und unterstützt verschiedene Rechentypen wie Skalar-, Vektor- und Tensorberechnungen. Er wurde für Schlüsseltechnologien wie Attention, MoE, AF-Trennung, PD-Trennung und großflächige Systemerweiterung optimiert. Unter komplexen Arbeitslasten berücksichtigt das Produkt Recheneffizienz, Betriebslatenz und Gesamtbetriebskosten (TCO) und erfüllt die umfassenden Anforderungen an Universalität, Leistung und Kosten für die großflächige KI-Anwendung.
Shan Tianyi, Leiter der KI- und Beschleunigungsrechnung bei Tianshu Zhixin, erklärte, dass die Künstliche Intelligenz von der „Informationsintelligenz“ (Verstehen und Generieren von Informationen) zur „Handlungsintelligenz“ (Planungs- und Ausführungsfähigkeiten) übergeht und sich zur „Erkundungsintelligenz“ (Modellierung und Vorhersage des Unbekannten) erweitert. Die unterschiedlichen Anforderungen dieser drei Intelligenzarten an die Berechnung bilden die Designlinie des Tian'e 300.
Für die Informationsintelligenz optimiert der Tian'e 300 gezielt Attention und MoE. Bei der Attention-Berechnung wird durch die Verbesserung der parallelen Effizienz von Matrix- und Vektorberechnungen die Wartezeit beim Datenlesen und -schreiben reduziert, wodurch bei verschiedenen Genauigkeiten eine Attention-Effizienz von über 90 % erreicht wird – besser als die Hopper-Lösung. In Szenarien mit einer Kontextlänge von 64k ist die Attention-Effizienz um 10 % höher als bei der Hopper-Lösung. Bei MoE wird durch die koordinierte Optimierung von Algorithmus und Hardware im DeepSeek V4 MoE-Szenario eine Recheneffizienz von über 70 % erzielt, wobei die Gesamttrainingsleistung und das Preis-Leistungs-Verhältnis die Hopper-Lösung übertreffen; in Inferenzszenarien ist die durchschnittliche Effizienz um 10 % höher als bei der Hopper-Lösung.
Für die Handlungsintelligenz verstärkt der Tian'e 300 die PD-Trennung und optimiert die Prefill- und Decode-Phasen differenziert. In Tests mit gängigen Modellen wie Qwen, GLM, Kimi und DeepSeek ist die Latenz des ersten Tokens im Vergleich zur Hopper-Lösung um etwa 20 % reduziert. Durch die Reduzierung des Protokoll-Overheads und die Optimierung der Verbindungspfade wird die durchschnittliche Kommunikationslatenz um etwa 13 % gesenkt. In Decode-Tests mit Modellen wie GLM 5.2 ist die Effizienz im Vergleich zur Hopper-Lösung um 10 % gesteigert.
Für die Erkundungsintelligenz unterstützt der Tian'e 300 Skalar-, Vektor- und Tensorberechnungen, deckt verschiedene Genauigkeiten wie FP4 und FP8 sowie Befehle wie MMA, DPX und FMA ab und ist für Aufgaben wie Matrixlösung, dynamische Programmierung, Sparse-Berechnung und digitale Zwillinge geeignet. Im Cosmos3-Weltmodell ist die Inferenzeffizienz im Vergleich zur Hopper-Lösung um 10 % höher.
Zu den zugrunde liegenden Architekturinnovationen, die die Leistung des Tian'e 300 stützen, gehören: ixSMEX, das durch eine höhere Datenwiederverwendungsrate wiederholte Speicherzugriffe reduziert; ixDPX, das die für die dynamische Programmierung ursprünglich erforderlichen sechs Befehle auf einen komprimiert; und ixTrans, das Speicherkonflikte und VRAM-Overhead reduziert. Seit 2018 hat Tianshu Zhixin seinen Software-Stack kontinuierlich verbessert und fast hundert Beschleunigungsbibliotheken entwickelt, die ein Werkzeugsystem für Kommunikation, Kompilierung, Treiber, Quantisierung und Leistungsanalyse bilden. Der Tian'e 300 unterstützt gängige globale Large-Model-Frameworks und wichtige Beschleunigungskomponenten. Derzeit ist das Produkt bereit für die großflächige Anwendung und wird tiefgehend mit inländischen chinesischen Cloud-Anbietern, Serverherstellern, Verbindungsökosystemen und Superknotensystemen integriert, um eine großflächige Bereitstellung von Einzelsystemen bis hin zu großen Clustern zu unterstützen.










