🛠️ Infrastructure & Deployment
Fokus: Die technische Grundlage und Hardware.
LLM Performance Hub
LLM-Performance ist ein Systemproblem, kein GPU-Einkaufsproblem. Ob man ein einzelnes Modell auf ...
LLM Hosting in 2026: Local, Self-Hosted und Cloud-Infrastruktur Vergleich
LLM Hosting — Übersicht und Entscheidungshilfe Large Language Models laufen längst nicht mehr nur...
Drei Rechner, ein Modell — llama.cpp RPC Cluster im Heimnetz
Ich habe drei Rechner zu Hause, die sonst meist im Leerlauf laufen. Die Idee: alle drei per llama...
Lokale Installation und Betrieb von LLMs mit vLLM
vLLM ist ein hochdurchsatzorientiertes Inference-Framework für Hugging-Face-Modelle. Im Vergleich...
llama.cpp — Installation, Betrieb und Konfiguration
llama.cpp ist mein primäres Inference-Backend — sowohl im Arbeitscluster als auch zu Hause. Es is...