KI-Ecke

Wir haben einen 576 GB großen KI-Server gebaut, auf dem GLM 5.2 läuft...

Kentinos On-Premise-KI-Server ist mit sechs NVIDIA RTX PRO 6000 Blackwell Max-Q-Grafikkarten, zwei EPYC-Prozessoren und ausreichend Redundanz ausgestattet, um auch einen Ausfall des Netzteils zu überstehen – so laufen Modelle der Spitzenklasse...

Wir haben einen 576 GB großen KI-Server gebaut, auf dem GLM 5.2 läuft...

Kentinos On-Premise-KI-Server ist mit sechs NVIDIA RTX PRO 6000 Blackwell Max-Q-Grafikkarten, zwei EPYC-Prozessoren und ausreichend Redundanz ausgestattet, um auch einen Ausfall des Netzteils zu überstehen – so laufen Modelle der Spitzenklasse...

Vollständige technische Anleitung: Flashen des CMP 170HX und Entsperren des 64 GB HBM2e-Speichers unter Ubuntu 22.04 LTS

Vollständiger technischer Leitfaden: Flashen von CMP 170HX & ...

# Vollständige technische Anleitung: Flashen des CMP 170HX & Entsperren von 64 GB HBM2e unter Ubuntu 22.04 LTS. Diese Anleitung beschreibt die vollständige Vorgehensweise zum Umgehen der werkseitigen OTP-Beschränkungen auf dem...

Vollständiger technischer Leitfaden: Flashen von CMP 170HX & ...

# Vollständige technische Anleitung: Flashen des CMP 170HX & Entsperren von 64 GB HBM2e unter Ubuntu 22.04 LTS. Diese Anleitung beschreibt die vollständige Vorgehensweise zum Umgehen der werkseitigen OTP-Beschränkungen auf dem...

Die Zukunft des KI-Computing erschließen: Wie kostengünstige GPUs und der entsperrte CMP 170HX das LLM-Hosting revolutionieren

Die Zukunft des KI-Computing erschließen: Wie Budget ...

Die weltweite rasante Entwicklung künstlicher Intelligenz hat eine beispiellose Nachfrage nach GPU-Rechenleistung mit hoher Dichte geschaffen. Für Startups, Unternehmen und Cloud-Infrastrukturanbieter ist die Anschaffung erstklassiger Enterprise-Beschleuniger wie NVIDIA...

Die Zukunft des KI-Computing erschließen: Wie Budget ...

Die weltweite rasante Entwicklung künstlicher Intelligenz hat eine beispiellose Nachfrage nach GPU-Rechenleistung mit hoher Dichte geschaffen. Für Startups, Unternehmen und Cloud-Infrastrukturanbieter ist die Anschaffung erstklassiger Enterprise-Beschleuniger wie NVIDIA...

Fallstudie: 4x RTX 4090 KI-Workstation

Dieser Artikel dokumentiert den kompletten Aufbau einer Workstation für einen Forschungskunden, der eine rackmontierbare, rund um die Uhr betriebsfähige LLM-Inferenz-Workstation mit ausreichend VRAM für Modelle der 70-Billionen-Klasse ohne Cloud-Abhängigkeit benötigte. Alles...

Fallstudie: 4x RTX 4090 KI-Workstation

Dieser Artikel dokumentiert den kompletten Aufbau einer Workstation für einen Forschungskunden, der eine rackmontierbare, rund um die Uhr betriebsfähige LLM-Inferenz-Workstation mit ausreichend VRAM für Modelle der 70-Billionen-Klasse ohne Cloud-Abhängigkeit benötigte. Alles...

TurboQuant: Lesen des KV-Cache-Komprimierungs-Br...

Lesezeit: 10 Min. | Wie Googles 3-Bit-Komprimierung die Kosten von Long-Context-LLMs senkt und was sie uns über die KI-Inferenz der nächsten 18 Monate verrät. Es herrscht Stillschweigen...

TurboQuant: Lesen des KV-Cache-Komprimierungs-Br...

Lesezeit: 10 Min. | Wie Googles 3-Bit-Komprimierung die Kosten von Long-Context-LLMs senkt und was sie uns über die KI-Inferenz der nächsten 18 Monate verrät. Es herrscht Stillschweigen...

VRAM-Anforderungen für KI-Modelle bei verschiedenen GPUs ...

VRAM-Anforderungen für KI-Modelle bei verschiedenen GPU-Konfigurationen. Diese Tabelle bietet einen Überblick über die ungefähren Modellgrößen (in Milliarden von Parametern), die auf verschiedenen VRAM-Konfigurationen ausgeführt werden können, zusammen...

VRAM-Anforderungen für KI-Modelle bei verschiedenen GPUs ...

VRAM-Anforderungen für KI-Modelle bei verschiedenen GPU-Konfigurationen. Diese Tabelle bietet einen Überblick über die ungefähren Modellgrößen (in Milliarden von Parametern), die auf verschiedenen VRAM-Konfigurationen ausgeführt werden können, zusammen...