KI-Ecke
Wir haben einen 576 GB großen KI-Server gebaut, auf dem GLM 5.2 läuft...
Kentinos On-Premise-KI-Server ist mit sechs NVIDIA RTX PRO 6000 Blackwell Max-Q-Grafikkarten, zwei EPYC-Prozessoren und ausreichend Redundanz ausgestattet, um auch einen Ausfall des Netzteils zu überstehen – so laufen Modelle der Spitzenklasse...
Wir haben einen 576 GB großen KI-Server gebaut, auf dem GLM 5.2 läuft...
Kentinos On-Premise-KI-Server ist mit sechs NVIDIA RTX PRO 6000 Blackwell Max-Q-Grafikkarten, zwei EPYC-Prozessoren und ausreichend Redundanz ausgestattet, um auch einen Ausfall des Netzteils zu überstehen – so laufen Modelle der Spitzenklasse...
Vollständiger technischer Leitfaden: Flashen von CMP 170HX & ...
# Vollständige technische Anleitung: Flashen des CMP 170HX & Entsperren von 64 GB HBM2e unter Ubuntu 22.04 LTS. Diese Anleitung beschreibt die vollständige Vorgehensweise zum Umgehen der werkseitigen OTP-Beschränkungen auf dem...
Vollständiger technischer Leitfaden: Flashen von CMP 170HX & ...
# Vollständige technische Anleitung: Flashen des CMP 170HX & Entsperren von 64 GB HBM2e unter Ubuntu 22.04 LTS. Diese Anleitung beschreibt die vollständige Vorgehensweise zum Umgehen der werkseitigen OTP-Beschränkungen auf dem...
Die Zukunft des KI-Computing erschließen: Wie Budget ...
Die weltweite rasante Entwicklung künstlicher Intelligenz hat eine beispiellose Nachfrage nach GPU-Rechenleistung mit hoher Dichte geschaffen. Für Startups, Unternehmen und Cloud-Infrastrukturanbieter ist die Anschaffung erstklassiger Enterprise-Beschleuniger wie NVIDIA...
Die Zukunft des KI-Computing erschließen: Wie Budget ...
Die weltweite rasante Entwicklung künstlicher Intelligenz hat eine beispiellose Nachfrage nach GPU-Rechenleistung mit hoher Dichte geschaffen. Für Startups, Unternehmen und Cloud-Infrastrukturanbieter ist die Anschaffung erstklassiger Enterprise-Beschleuniger wie NVIDIA...
Fallstudie: 4x RTX 4090 KI-Workstation
Dieser Artikel dokumentiert den kompletten Aufbau einer Workstation für einen Forschungskunden, der eine rackmontierbare, rund um die Uhr betriebsfähige LLM-Inferenz-Workstation mit ausreichend VRAM für Modelle der 70-Billionen-Klasse ohne Cloud-Abhängigkeit benötigte. Alles...
Fallstudie: 4x RTX 4090 KI-Workstation
Dieser Artikel dokumentiert den kompletten Aufbau einer Workstation für einen Forschungskunden, der eine rackmontierbare, rund um die Uhr betriebsfähige LLM-Inferenz-Workstation mit ausreichend VRAM für Modelle der 70-Billionen-Klasse ohne Cloud-Abhängigkeit benötigte. Alles...
TurboQuant: Lesen des KV-Cache-Komprimierungs-Br...
Lesezeit: 10 Min. | Wie Googles 3-Bit-Komprimierung die Kosten von Long-Context-LLMs senkt und was sie uns über die KI-Inferenz der nächsten 18 Monate verrät. Es herrscht Stillschweigen...
TurboQuant: Lesen des KV-Cache-Komprimierungs-Br...
Lesezeit: 10 Min. | Wie Googles 3-Bit-Komprimierung die Kosten von Long-Context-LLMs senkt und was sie uns über die KI-Inferenz der nächsten 18 Monate verrät. Es herrscht Stillschweigen...
VRAM-Anforderungen für KI-Modelle bei verschiedenen GPUs ...
VRAM-Anforderungen für KI-Modelle bei verschiedenen GPU-Konfigurationen. Diese Tabelle bietet einen Überblick über die ungefähren Modellgrößen (in Milliarden von Parametern), die auf verschiedenen VRAM-Konfigurationen ausgeführt werden können, zusammen...
VRAM-Anforderungen für KI-Modelle bei verschiedenen GPUs ...
VRAM-Anforderungen für KI-Modelle bei verschiedenen GPU-Konfigurationen. Diese Tabelle bietet einen Überblick über die ungefähren Modellgrößen (in Milliarden von Parametern), die auf verschiedenen VRAM-Konfigurationen ausgeführt werden können, zusammen...