DeepSeek stellt mHC vor, steht jedoch vor Hürden der Peer-Review

- DeepSeek schlägt einen neuen Weg vor, KI ohne zusätzliche Rechenleistung zu skalieren.
- Forscher sehen Potenzial, warnen aber, dass weitere Tests noch notwendig sind.
- mHC könnte die Art und Weise verändern, wie große Sprachmodelle trainiert werden.
Angesichts der steigenden Kosten für die Entwicklung und Wartung von KI sowie der begrenzten Verfügbarkeit von Hardware hat DeepSeek einen neuen Plan zur Entwicklung und Skalierung von künstlicher Intelligenz (KI) vorgestellt.
Das in China ansässige Start-up ist der Überzeugung, deutlich bessere KI-Modelle erstellen zu können, ohne zwangsläufig mehr Chips hinzuzufügen und damit den Stromverbrauch zu erhöhen. Obwohl das vorgeschlagene mHC-Konzept bei vielen Forschern auf großes Interesse gestoßen ist, gilt es allgemein noch als frühes Stadium.
Es sind weitere Forschungen erforderlich, um die Vorteile des Ansatzes bei der Entwicklung größerer KI-Systeme zu bestimmen. Ein technisches Papier, das das mHC-Konzept detailliert beschreibt, wurde letzte Woche veröffentlicht und ist Mitautor von Liang Wenfeng, dem Gründer und CEO von DeepSeek.
DeepSeek überdenkt Netzwerkdesign zur Skalierung von KI
Eine der Hauptkomponenten der Arbeit ist die Neubewertung der Übertragung von Informationen zwischen den verschiedenen Schichten eines mehrschichtigen neuronalen Netzwerks.
Jede Schicht in einem neuronalen Netzwerk gibt eine Form verarbeiteter Information an die nächste Schicht im Modell weiter, was zu dem führt, was als „Residual Learning Network“ (ResNet) bezeichnet wird. Entwickelt von Kaiming He und anderen von Microsoft Research vor etwa zehn Jahren, lieferten ResNets die grundlegende Basis für eine Reihe der heute fortschrittlichsten KI-Systeme.
Ein Konzept, das von DeepSeek entwickelt wurde, entstand, nachdem ByteDance 2024 Hyper-Connections vorstellte. Hyper-Connections ermöglichen es Informationen, mehrere Routen durch ein Netzwerk zu durchlaufen, anstatt nur einen Hauptpfad, was die Geschwindigkeit des Lernens und die Reichhaltigkeit der Erfahrung erhöhen kann.
Obwohl sie vorteilhaft sein können, können sie auch zu problematischen Trainingsvorgängen führen, bei denen Modelle auf Trainingsinstabilität oder einen vollständigen Ausfall stoßen.
Laut Song Linqi (City University of Hong Kong) ist DeepSeeks Forschung eine Weiterentwicklung einer bestehenden Idee und eine Fortsetzung dessen, wie DeepSeek die Arbeit anderer Unternehmen betrachtet, anstatt etwas von Grund auf neu zu erfinden.
ResNet wird mit einer einspurigen Schnellstraße verglichen, während Hyper-Connections einer mehrspurigen Schnellstraße ähneln; Song warnte jedoch davor, dass mehrere Spuren ohne angemessene Regeln zu mehr Kollisionen führen können.
Professor Guo Song der Hong Kong University of Science and Technology glaubt, dass diese Forschungsarbeit auf ein verändertes Forschungsverhalten für KI-Forschung hindeuten könnte. Statt weiterhin kleine Modifikationen an den Designs bestehender Modelle vorzunehmen, glaubt er, dass sich die Forschung in Richtung der Entwicklung neuer Modelle auf der Grundlage theoretischer Konstrukte entwickeln wird.
Forscher testen mHC, äußern jedoch praktische Bedenken
Obwohl es Begeisterung über den kürzlich erreichten Meilenstein beim Testen von mHC für Deep Learning gibt, haben Experten betont, dass die Forschung noch nicht abgeschlossen ist. Das von DeepSeek bereitgestellte Testen nutzte nur vier Datenpfade beim Testen von Modellen mit 27 Milliarden Parametern.
„Die Experimente validierten Modelle mit bis zu 27 Milliarden Parametern, aber wie würde es bei heutigen Spitzmodellen performen, die um eine Größenordnung größer sind?“
Professor Guo Song.
Die heute verfügbaren KI-Modelle sind größer und haben typischerweise Hunderte von Milliarden Parametern im Vergleich zu den 30 Milliarden Parametern, die vor wenigen Jahren noch Standard waren.
Guo teilte diese Bedenken und erklärte, dass noch niemand abschließend beurteilen könne, ob mHC in der Lage sein wird, an der Spitze der KI-Technologie zu arbeiten. Er erklärte auch, dass die für das Funktionieren von mHC erforderliche Infrastruktur für kleinere Forschungsinstitute zu fortgeschritten und für Unternehmen zur Nutzung auf mobilen Geräten möglicherweise nicht geeignet sei.
Laut Cryptopolitan kam die Popularität von DeepSeek aus der Veröffentlichung des Large-Language-Modells DeepSeek V3 und der anschließenden Veröffentlichung ihres Reasoning-Modells DeepSeek-R1 nur wenige Wochen später.
Bei der Vergleich der Ergebnisse der Modelle mit ihren Wettbewerbern in Benchmark-Tests konnten beide Modelle die Ergebnisse ihrer Wettbewerber erreichen oder übertreffen, obwohl sie nur mit einem Bruchteil der Trainingsdaten veröffentlicht wurden, die für die anderen konkurrierenden Sprachmodelle verwendet wurden.
Die klügsten Krypto-Köpfe lesen bereits unseren Newsletter. Lust dabei? Mach mit.
Enacy Mapakame
Enacy Mapakame ist Journalistin mit über 10 Jahren Erfahrung in den Bereichen Wirtschafts- und Finanznachrichten. Sie berichtet über Kapitalmärkte und aufstrebende Technologien – das Metaverse, KI und Kryptowährungen. Enacy besitzt einen Bachelor of Science (BSc) im Fachbereich Medien- und Gesellschaftsstudien mit Auszeichnung.















