de.wedoany.com-Bericht: Das chinesische Unternehmen Lynxi Technology hat auf der WAIC sein selbst entwickeltes neuromorphes Superknoten-Clusterprodukt LynAInfra (灵琍) vorgestellt. Dieses Produkt bietet mit einer Leistungsaufnahme von 30 kW nahezu 100 P Rechenleistung und zielt auf die beiden Hauptprobleme der KI-Inferenzbranche ab: hoher Energieverbrauch und hohe Latenz.

Die skalierte Umsetzung von KI-Inferenzdiensten steht derzeit vor den doppelten Engpässen eines zu hohen Energieverbrauchs und einer zu hohen Inferenzlatenz. Selbst bei ständiger Weiterentwicklung von GPUs bleiben die grundlegenden Einschränkungen traditioneller Chip-Architekturen unüberwunden. Gleichzeitig steigen die Marktanforderungen an Inferenzlatenz und Nutzungskosten, insbesondere in hochwertigen Szenarien wie KI-Programmierbeschleunigung, KI-Videogenerierung und Multi-Agenten-Kooperation. Nvidias Engagement bei Groq zur Verstärkung des Hochgeschwindigkeits-Inferenzbereichs bestätigt ebenfalls, dass die Branche dringend nach innovativen Lösungen für die Inferenzarchitektur sucht. Lynxi Technology nutzt die Eigenschaften seiner selbst entwickelten neuromorphen Chips – In-Memory-Computing, ereignisgesteuert und viele parallele Kerne – und bringt den neuromorphen Hochleistungs-Superknoten LynAInfra für Hochgeschwindigkeits-Inferenzszenarien auf den Markt. Dessen Inferenz-Energieeffizienzverhältnis ist im Vergleich zu traditionellen GPU-Lösungen um das 3- bis 10-fache verbessert, und die Latenz des ersten Tokens wird auf einige Dutzend bis hundert Millisekunden reduziert.

Das Superknoten-Cluster LynAInfra basiert auf neuromorphen Chips, die in China bereits im großen Maßstab kommerziell eingesetzt werden. Sein Rechenrack LynAInfra128 ist mit 128 HP640-Serienplatinen bestückt, koppelt in einem einzelnen Rack tausende neuromorphe Chips und setzt eine Rechenleistung von nahezu 100 P@FP16 frei, wobei die Gesamtleistungsaufnahme des Systems unter 30 kW gehalten wird. Das Produkt verwendet das selbst entwickelte Hochgeschwindigkeits-Interconnect-Protokoll LynxLink und eine Unified-Memory-Address-Compilation-Technologie, unterstützt die Skalierung der Rechenleistung innerhalb eines Racks (Scale up) sowie die horizontale Erweiterung über mehrere Racks (Scale out). Die Geräte verwenden eine luftgekühlte Lösung und ein modulares Design, sind mit vorhandenen Einrichtungen wie Rechenzentrumsracks, Stromversorgung und Netzwerken kompatibel und senken so die Umstellungskosten für Kunden.

LynAInfra realisiert von der Chip-Architektur bis zur Cluster-Interconnect eine vollständige Innovationskette. Mehrere Racks können nahtlos gekoppelt werden, um Inferenzaufgaben für sehr große Modelle zu bewältigen. Dank der architekturbedingten Energieeinsparung bietet das Produkt bei einer Leistungsaufnahme von 30 kW nahezu 100 P Rechenleistung, was zur Reduzierung der CO₂-Emissionen während der Rechenleistungsnutzung beiträgt und der chinesischen Doppelkohlenstoffstrategie entspricht. Für Unternehmenskunden senkt es die Rechenkosten pro Einheit für die Inferenz großer Modelle und fördert den Einsatz großer Modelle in Szenarien wie der digitalen Transformation der Industrie, der Stadtverwaltung und der Spitzenforschung. Das gesamte System verfolgt einen Weg der unabhängigen nationalen Innovation und zielt darauf ab, die Sicherheit der chinesischen Rechenleistungs-Lieferkette zu stärken.










