Chinesisches PPIO stellt Modell-Gateway vor, tägliche Token-Aufrufe im Juni über 1,2 Billionen
2026-07-20 11:36
Merken

de.wedoany.com-Bericht: Auf der WAIC 2026 hat das chinesische Unternehmen PPIO offiziell die Positionierung als Agentic Cloud und das neue intelligente Modell-Gateway vorgestellt und die Schaffung einer „intelligenten Token-Fabrik“ für das Agent-Zeitalter angekündigt. Da der globale Markt für KI-Agenten voraussichtlich von 5,1 Milliarden US-Dollar im Jahr 2024 auf 47,1 Milliarden US-Dollar im Jahr 2030 wachsen wird, steigt der Token-Bedarf für Agent-Aufgaben rasant an.

Yao Xin, Mitbegründer und CEO von PPIO, wies darauf hin, dass die Kunden für Tokens sich von Menschen zu Agenten verlagern und Cloud-Dienstleister eine „Token-Fabrik“ mit geringerer Latenz und höherem Durchsatz bereitstellen müssen. Laut Daten von China Insights Consultancy sinken die Inferenzkosten zwar jährlich um mehr als das Zehnfache, doch die Anzahl der von einem einzelnen Agent-Auftrag verbrauchten Tokens ist von einigen Hundert in der Anfangszeit auf Zehntausende oder sogar Hunderttausende gestiegen, sodass der Gesamtkostendruck nicht sinkt, sondern steigt. Gleichzeitig kann ein einzelnes Modell die vielfältigen Anforderungen von Agenten nicht abdecken, und die Anforderungen an Latenz und Stabilität sind bei Agenten weitaus höher als bei traditionellen KI-Anwendungen.

Das von PPIO vorgestellte Kernprodukt, das intelligente Modell-Gateway, verwendet einen „Mixture of Models“ (MoM)-Mechanismus. In kritischen Agent-Schritten verteilt das Gateway die Anfrage an mehrere Expertenmodelle, die durch Kreuzvalidierung eine Antwort generieren, um Aufgabenfehler aufgrund von Modellverzerrungen zu vermeiden. Das Gateway verfügt außerdem über intelligente Planungs- und Kostenoptimierungsfähigkeiten, leitet Aufgaben je nach Typ weiter und kontrolliert die Kosten durch Mechanismen wie Komprimierung redundanter Kontexte und Budgetbegrenzungen. Laut dem DRACO-Tiefenforschungs-Benchmark-Test kann PPIO durch die Integration von Mimo-V2.5-Pro, Kimi-K2.7 und GLM-5.2 für gemischte Inferenz die Leistung auf ein Niveau nahe Claude Fable 5 steigern, die Intelligenz um 20 % verbessern und die Kosten um 50 %–60 % senken. Die selbst entwickelte Inferenzbeschleunigungs-Engine von PPIO ist für Agent-Szenarien tiefgehend optimiert und kann die Inferenzleistung um bis zu das Zehnfache steigern. In Kombination mit der Prompt-Cache-Technologie können die Token-Kosten um bis zu 80 % gesenkt werden. PPIO wurde von der Chinesischen Akademie für Informations- und Kommunikationstechnologie in die erste Charge der „Enterprise-Level Token Service Performance Climbing Baseline“ aufgenommen, mit einer TPS von ≥55/Sekunde, einer TTFT von ≤0,9 Sekunden und einer Aufruferfolgsrate von ≥99,9 % in allgemeinen Szenarien.

Im Bereich der Agent-Laufzeitumgebung hat PPIO die Agent-Sandbox eingeführt, die auf microVM-Technologie basiert und einen Kaltstart im Millisekundenbereich (<200ms) ermöglicht. Jede Aufgabe läuft in einer unabhängigen virtuellen Maschinenumgebung, unterstützt die gleichzeitige Erstellung von Zehntausenden Sandboxen, und der Auto-Pause/Resume-Mechanismus senkt die Kosten im Vergleich zu ähnlichen Produkten um bis zu über 90 %. Seit der Veröffentlichung auf der WAIC im letzten Jahr ist das Geschäftsvolumen dieser ersten chinesischen Agent-Sandbox mit E2B-Schnittstelle um mehr als das 123-fache gewachsen. PPIO Agent Harness integriert Funktionen wie Browser Use, Computer Use, Code Interpreter und MCP Server und deckt die gesamte Kette von der Informationsbeschaffung bis zur Ausführung von Aktionen ab. Die Plattform bietet vorkonfigurierte Agent-Vorlagen wie PPClaw und PPHermes, sodass Entwickler die Bereitstellung in der Cloud in nur 10 Minuten abschließen können, und unterstützt gleichzeitig einen 7×24-Stunden-Dauerbetrieb sowie die Planung zeitgesteuerter Aufgaben.

In Bezug auf die Daten überstieg die durchschnittliche tägliche Token-Aufrufmenge von PPIO im Juni 2026 1,2 Billionen, was den ersten Platz unter den unabhängigen KI-Cloud-Dienstanbietern in China bedeutet und einem Anstieg von mehr als dem Achtfachen im Vergleich zum gleichen Zeitraum 2025 entspricht. Der Umsatz des Unternehmens stieg von 358,4 Millionen RMB im Jahr 2023 auf 770,3 Millionen RMB im Jahr 2025, und die Zahl der weltweit registrierten Entwickler überstieg 670.000. Die durchschnittliche GPU-Auslastung von PPIO lag 2025 konstant über 75 %, weit über dem Branchendurchschnitt von 40 %–50 %. Yao Xin erklärte, dass PPIO durch die Fähigkeit des globalen Scheduling-Netzwerks, Spitzen zu glätten und Täler zu füllen, und unter Nutzung der Zeitverschiebung zwischen Ost- und Westhalbkugel die GPU-Auslastung auf 70 %–80 % bringt. Derzeit hat PPIO verteilte Multi-Cluster in Europa, Nordamerika, Südamerika, Südostasien und anderen Regionen eingerichtet, die alle sechs Kontinente abdecken.

Yao Xin sagte, dass die Intelligenzgrenze nicht nur innerhalb des Modells liege, sondern auch außerhalb des Modells in den Bereichen Agent-Engineering und Modellfusion die Intelligenz erheblich steigern könne. PPIO ist bestrebt, durch günstigere Tokens und stabilere Agent-Ausführung die grundlegende Infrastruktur für den Ausbruch der Agentenwirtschaft im Voraus zu schaffen.

Auf der Harness-Ebene bietet die Plattform vorkonfigurierte, sofort einsatzbereite Agent-Vorlagen wie PPClaw und PPHermes. Entwickler können über die Konsole mit einem Klick eine Cloud-Bereitstellung durchführen, die in nur 10 Minuten betriebsbereit ist. Nach der Bereitstellung wird ein 7×24-Stunden-Dauerbetrieb und die Planung zeitgesteuerter Aufgaben unterstützt. Bei Nichtgebrauch kann die Abrechnung mit einem Klick pausiert werden, und die Wiederherstellung erfolgt in Sekundenschnelle. Die Plattform bietet außerdem KI-native Schnittstellen für Agenten, die das MCP-Standardprotokoll unterstützen, sodass Agenten über natürliche Sprache auf GPU-Rechenleistung, Sandbox-Umgebungen und andere Infrastrukturen zugreifen können. Die Plattform ist mit gängigen Agent-Frameworks wie LangChain, CrewAI und AutoGen kompatibel.

Das verteilte Rechennetzwerk und die hochdichten Rechenknoten von PPIO bilden die grundlegende Unterstützung für die intelligente Token-Fabrik. Durch die Nutzung von Zeitverschiebungen zwischen Regionen und den unterschiedlichen Anforderungen einer vielfältigen Kundschaft werden weltweit ungenutzte Rechenressourcen dynamisch an Spitzenbedarfsorte verteilt, um eine effektive Nutzung der GPU-Ressourcen sicherzustellen. Diese Planungsfähigkeit senkt direkt die tatsächlichen Kosten pro Token und bildet die grundlegende Absicherung des „Vorderladen-Hinterfabrik“-Modells von PPIO.

Diese Kurznachricht stammt aus der Übersetzung und Weiterverbreitung von Informationen aus dem globalen Internet und von strategischen Partnern. Sie dient lediglich dem Austausch mit den Lesern. Bei Urheberrechtsverletzungen oder anderen Problemen bitten wir um rechtzeitige Mitteilung, und wir werden die notwendigen Änderungen oder Löschungen vornehmen. Die Weitergabe dieses Artikels ist ausdrücklich ohne formelle Genehmigung verboten.E-Mail: news@wedoany.com