DSpark: Deepseek verbessert mit Token-Raten die GPU-Auslastung
Der chinesische KI-Entwickler Deepseek ist bekannt für aufwendige Optimierung, um große Modelle möglichst effizient betreiben zu können. Bereits Deepseek-V4 brachte neue Optimierungen zur Verbesserung der Hardware-Auslastung mit, DSpark legt hier noch einmal nach. Deepseek entwickelte das Konzept zusammen mit Forschern der Universität Peking; wie immer wurden Details zur Implementierung und eine Analyse veröffentlicht(öffnet im neuen Fenster).
Die Messungen zeigen Steigerungen der pro Sekunde und GPU generierten Tokens um bis zu 661 Prozent bei Deepseek-V4 Flash. Realisieren lässt sich dies aber nur bei Zusicherung von Service Level Agreements (SLAs), wenn also Nutzern ein Mindestdurchsatz an Token pro Sekunde zugesichert wird. DSpark ermöglicht damit, die SLAs deutlich anzuheben oder mehr Nutzer auf ein System abzubilden, wodurch die höhere Auslastung zustande kommt.