{"id":2634,"date":"2026-09-14T16:49:10","date_gmt":"2026-09-14T14:49:10","guid":{"rendered":"https:\/\/www.it-resell.com\/blog\/?p=2634"},"modified":"2026-09-14T16:49:10","modified_gmt":"2026-09-14T14:49:10","slug":"blogs-a100-gpu-server-llm-inferenz","status":"publish","type":"post","link":"https:\/\/www.it-resell.com\/blog\/it-kaufberatung\/blogs-a100-gpu-server-llm-inferenz","title":{"rendered":"A100 GPU-Server f\u00fcr LLM-Inferenz: Labortest mit 8\u00d7 NVIDIA A100"},"content":{"rendered":"\n<div class=\"keyfacts\"><div class=\"kf\"><b class=\"kf-num\">5.187 tok\/s<\/b><span>Maximaler Gesamtdurchsatz mit Qwen3.6-27B \u00fcber beide Nodes bei 128 parallelen Anfragen<\/span><\/div><div class=\"kf\"><b class=\"kf-num\">109 tok\/s<\/b><span>Geschwindigkeit f\u00fcr den Einzelnutzer beim 397B-Modell, mit MTP Speculative Decoding<\/span><\/div><div class=\"kf\"><b class=\"kf-num\">Faktor 4,2<\/b><span>Mehr Durchsatz allein durch den richtigen Quantisierungs-Kernel (Marlin statt Triton)<\/span><\/div><div class=\"kf\"><b class=\"kf-num\">0,27 Wh<\/b><span>Energieverbrauch je 1.000 erzeugte Tokens beim 27B-Modell unter Volllast<\/span><\/div><div class=\"kf\"><b class=\"kf-num\">~250 Sessions<\/b><span>Realistische parallele Nutzerzahl mit dem 27B-Modell \u00fcber beide Nodes hinweg<\/span><\/div><\/div>\n\n\n\n<p class=\"wp-block-paragraph\">Kann eine vier Jahre alte NVIDIA-A100-Generation ohne FP8-Unterst\u00fctzung heute noch ein aktuelles Sprachmodell produktiv betreiben? Wir haben getestet: drei Tage, zwei Server-Nodes, acht A100-GPUs, und echte Zahlen statt Datenblatt-Versprechen.Wer heute einen eigenen KI-Server f\u00fcr den Betrieb gro\u00dfer Sprachmodelle plant, st\u00f6\u00dft schnell auf dieselbe Frage: Reicht gebrauchte NVIDIA-A100-Hardware noch aus, oder f\u00fchrt an teurer Hopper- oder Blackwell-Generation kein Weg vorbei? Hersteller-Datenbl\u00e4tter beantworten das nicht: sie zeigen Peak-Werte unter Laborbedingungen, keine Praxis unter echter Last.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Wir haben deshalb einen A100-GPU-Server drei Tage lang unter realistischer Last getestet: ein HPE Apollo 6500 Gen10 Plus mit acht NVIDIA A100 SXM4 40GB, verteilt \u00fcber zwei per InfiniBand gekoppelte Server-Nodes. Getestet wurden zwei aktuelle Open-Weight-Modelle, ein gro\u00dfes 397-Milliarden-Parameter-Modell und ein schlankes 27-Milliarden-Parameter-Modell, unter neun Benchmark-Konfigurationen.<br>Das Ergebnis \u00fcberrascht: Die entscheidende Stellschraube war nicht die Netzwerk-Bandbreite und nicht die Anzahl der GPUs, sondern eine einzige Software-Einstellung. Dieser Artikel zeigt die vollst\u00e4ndigen Zahlen, die Fehler unterwegs und was das f\u00fcr die Kaufentscheidung bedeutet.<\/p>\n\n\n\n<h2 id=\"das-testsystem-hpe-apollo-6500-gen10-plus-mit-8x-nvidia-a100\" class=\"wp-block-heading\">Das Testsystem: HPE Apollo 6500 Gen10 Plus mit 8\u00d7 NVIDIA A100<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Das Testsystem bestand aus zwei HPE ProLiant XL645d Gen10 Plus Node-Servern im Apollo-6500-Chassis, dem Formfaktor, den HPE f\u00fcr dichte GPU-Workloads wie KI-Training und -Inferenz vorsieht [1]. Jeder Node war mit vier NVIDIA A100-SXM4-40GB-GPUs best\u00fcckt, intern per NVLink-Mesh verbunden, macht acht A100-GPUs mit insgesamt 320 GB HBM2-Speicher im Gesamtsystem.<br>Die beiden Nodes waren \u00fcber ConnectX-6-Adapter direkt per InfiniBand HDR100 verkabelt, ohne Switch dazwischen: gemessen wurden 11,5 GB\/s Bandbreite und 15,3 GB\/s Allreduce-Bandbreite \u00fcber NCCL bei allen acht GPUs gemeinsam. Als Prozessoren kamen AMD-EPYC-CPUs mit 128 Threads und rund 500 GB RAM pro Node zum Einsatz, dazu 745 GB NVMe-Storage f\u00fcr Modellgewichte und gespiegelte SAS-Laufwerke f\u00fcr Daten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Software-seitig lief Ubuntu Server 24.04 mit NVIDIA-Treiber 580 und CUDA 13, containerisiert \u00fcber Docker mit dem NVIDIA Container Toolkit. Als Inferenz-Engine kam vLLM zum Einsatz, die etablierte Open-Source-L\u00f6sung f\u00fcr produktiven LLM-Betrieb, die auch vielen kommerziellen Inferenz-APIs zugrunde liegt.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ein Detail bestimmte die gesamte Modellauswahl: Ampere-GPUs wie die A100 unterst\u00fctzen weder FP8- noch NVFP4-Datentypen und keine der Hopper-spezifischen Kernel wie Sparse-MLA oder FlashAttention 3. Damit schieden aktuelle Flaggschiff-Modelle wie GLM-5.3-Flash, DeepSeek V4, MiniMax M3 oder Kimi K3 von vornherein aus, ebenso alle Modelle \u00fcber etwa 350 Milliarden Gesamtparametern, da deren komprimierte Gewichte selbst als INT4 nicht mehr in 320 GB HBM2 passen. Wer mit gebrauchter Ampere-Hardware plant, muss diese Grenze kennen, bevor er ein Modell ausw\u00e4hlt. \u00c4hnliche Einschr\u00e4nkungen gelten auch f\u00fcr andere Ampere-Systeme wie die HPE Smart Choice Server-Reihe.<\/p>\n\n\n\n<h2 id=\"testmethodik-wie-belastbar-sind-die-zahlen\" class=\"wp-block-heading\">Testmethodik: Wie belastbar sind die Zahlen?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Alle Messungen liefen mit vllm bench serve gegen den laufenden Server, nicht gegen synthetische Microbenchmarks. Als Eingabe dienten Zufallsdaten mit 2.048 Input- und 1.024 Output-Tokens, jeweils drei Prompts pro Lastszenario, bei steigender Parallelit\u00e4t von 1 \u00fcber 8, 32 und 64 bis zu 128 gleichzeitigen Anfragen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Drei Messgr\u00f6\u00dfen bestimmen jede Zeile in den folgenden Tabellen: der Output-Durchsatz in Tokens pro Sekunde (tok\/s) als Kapazit\u00e4t des Gesamtsystems, die Time to First Token (TTFT) als Wartezeit bis zur ersten sichtbaren Antwort inklusive Warteschlange, und die Time per Output Token (TPOT), aus der sich die von einem einzelnen Nutzer wahrgenommene Geschwindigkeit ableitet. Vor jedem Lauf wurde der Server neu gestartet und \u00fcber den Health-Endpoint auf vollst\u00e4ndige Bereitschaft gepr\u00fcft, damit keine Anlaufzeiten die Ergebnisse verf\u00e4lschen.<\/p>\n\n\n\n<h2 id=\"das-grosse-modell-qwen3-5-397b-a17b-im-multi-node-betrieb\" class=\"wp-block-heading\">Das gro\u00dfe Modell: Qwen3.5-397B-A17B im Multi-Node-Betrieb<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Qwen3.5-397B-A17B ist ein Mixture-of-Experts-Modell mit 397 Milliarden Gesamt- und 17 Milliarden aktiven Parametern, inklusive Vision-Encoder, 262.000 Token Kontextfenster und Apache-2.0-Lizenz [4]. Als 4-Bit-quantisierte GPTQ-Variante belegen die Gewichte rund 220 GB, zu gro\u00df f\u00fcr einen einzelnen 4-GPU-Node, weshalb das Modell mit Tensor-Parallel \u00fcber beide Nodes hinweg (TP=8) betrieben wurde, verteilt per InfiniBand.<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><picture><source type=\"image\/webp\" srcset=\"https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-illustration-01-neu-2.webp 800w, https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-illustration-01-neu-2-300x188.webp 300w, https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-illustration-01-neu-2-768x480.webp 768w\" sizes=\"auto, (max-width: 800px) 100vw, 800px\"><img loading=\"lazy\" decoding=\"async\" width=\"800\" height=\"500\" src=\"https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-illustration-01-neu-2.png\" alt=\"Konzeptgrafik Tensor-Parallel gegen\u00fcber Pipeline-Parallel bei Multi-GPU-Betrieb von gro\u00dfen Sprachmodellen\" class=\"wp-image-2642\" srcset=\"https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-illustration-01-neu-2.png 800w, https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-illustration-01-neu-2-300x188.png 300w, https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-illustration-01-neu-2-768x480.png 768w\" sizes=\"auto, (max-width: 800px) 100vw, 800px\" \/><\/picture><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Tensor-Parallel verteilt jede Schicht auf alle Karten, Pipeline-Parallel rechnet Schichtabschnitte nacheinander. Im Test war Tensor-Parallel deutlich schneller. (Quelle: IT-RESELL.COM)<\/em><\/p>\n\n\n\n<h3 class=\"wp-block-heading\">F\u00fcnf Konfigurationen, eine Erkenntnis: der Kernel entscheidet<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Getestet wurden f\u00fcnf aufeinander aufbauende Betriebsvarianten desselben Modells, es \u00e4nderte sich nie das Modell, nur wie vLLM es \u00fcber die acht Karten verteilt und ausf\u00fchrt:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Basis: <\/strong>Tensor-Parallel \u00fcber 8 GPUs mit generischem Triton-Kernel (Ausgangspunkt, offizielle Recipe-Vorgabe)<\/li>\n\n\n\n<li><strong>PP: <\/strong>Pipeline-Parallel statt Tensor-Parallel, Test der Annahme, das Netzwerk sei der Engpass<\/li>\n\n\n\n<li><strong>A (Marlin): <\/strong>gleicher Aufbau wie Basis, aber mit handoptimiertem Entpack-Kernel f\u00fcr die INT4-Gewichte<\/li>\n\n\n\n<li><strong>B (+MTP): <\/strong>zus\u00e4tzlich Speculative Decoding (Multi-Token Prediction) f\u00fcr den Einzelnutzer<\/li>\n\n\n\n<li><strong>C (+Async Scheduling): <\/strong>l\u00f6st die durch MTP verursachte Scheduler-Last bei vielen Nutzern wieder auf<\/li>\n\n\n\n<li><strong>D (+Expert Parallel): <\/strong>verteilt ganze MoE-Experten statt Schichtscheiben auf die Karten<\/li>\n<\/ul>\n\n\n\n<link href=\"https:\/\/fonts.googleapis.com\/css2?family=Manrope:wght@400;500;600;700;800&#038;display=swap\" rel=\"stylesheet\">\n\n<style>\n.itresell-price-table {\n  width: 100%;\n  border-collapse: collapse;\n  font-family: 'Manrope', -apple-system, sans-serif;\n  font-size: 0.91rem;\n  line-height: 1.55;\n  margin: 0.5rem 0 1rem;\n  border-radius: 10px;\n  overflow: hidden;\n  box-shadow: 0 2px 12px rgba(19,82,35,0.13);\n}\n.itresell-price-table thead tr { background: #135223; color: #fff; }\n.itresell-price-table thead th {\n  padding: 14px 18px;\n  text-align: left;\n  font-weight: 700;\n  font-size: 0.82rem;\n  letter-spacing: 0.04em;\n  border: none;\n  text-transform: uppercase;\n}\n.itresell-price-table tbody tr { background: #ffffff; }\n.itresell-price-table tbody td {\n  padding: 13px 18px;\n  border-bottom: 1px solid #c8e0c8;\n  vertical-align: top;\n  color: #1a1a1a;\n  background: #ffffff;\n}\n.itresell-price-table tbody td:first-child {\n  font-weight: 700;\n  background: #e8f6e9;\n}\n.itresell-price-table tbody tr:last-child td { border-bottom: none; }\n<\/style>\n\n<table class=\"itresell-price-table\">\n  <thead>\n    <tr>\n      <th>Konfiguration<\/th>\n      <th>Einzeln. tok\/s<\/th>\n      <th>TTFT<\/th>\n      <th>Bester Wert<\/th>\n      <th>bei N<\/th>\n      <th>TTFT dort<\/th>\n    <\/tr>\n  <\/thead>\n  <tbody>\n    <tr>\n      <td>Basis (Triton)<\/td>\n      <td>41<\/td>\n      <td>1,0 s<\/td>\n      <td>155 tok\/s<\/td>\n      <td>32<\/td>\n      <td>5,5 s<\/td>\n    <\/tr>\n    <tr>\n      <td>PP (TP4\/PP2)<\/td>\n      <td>34<\/td>\n      <td>1,6 s<\/td>\n      <td>212 tok\/s<\/td>\n      <td>128<\/td>\n      <td>21 s<\/td>\n    <\/tr>\n    <tr>\n      <td>A (Marlin)<\/td>\n      <td>70<\/td>\n      <td>0,6 s<\/td>\n      <td>627 tok\/s<\/td>\n      <td>64<\/td>\n      <td>7,3 s<\/td>\n    <\/tr>\n    <tr>\n      <td>B (+MTP)<\/td>\n      <td>109<\/td>\n      <td>1,0 s<\/td>\n      <td>499 tok\/s<\/td>\n      <td>64<\/td>\n      <td>79 s<\/td>\n    <\/tr>\n    <tr>\n      <td>C (+Async)<\/td>\n      <td>109<\/td>\n      <td>1,0 s<\/td>\n      <td>661 tok\/s<\/td>\n      <td>32<\/td>\n      <td>2,5 s<\/td>\n    <\/tr>\n    <tr>\n      <td>D (+Expert Parallel)<\/td>\n      <td>104<\/td>\n      <td>1,0 s<\/td>\n      <td>693 tok\/s*<\/td>\n      <td>32<\/td>\n      <td>2,6 s<\/td>\n    <\/tr>\n  <\/tbody>\n<\/table>\n\n\n\n<p class=\"wp-block-paragraph\"><em>* Konfiguration D st\u00fcrzte bei 64 parallelen Anfragen mit einem Engine-Fehler ab.<\/em><\/p>\n\n\n\n<div style=\"background:#f0f9f3;border-left:4px solid #70DE00;border-radius:6px;padding:16px 20px;margin:24px 0;font-family:Arial,sans-serif;color:#135223;line-height:1.5;font-size:14px;\">\n \n  <p style=\"margin:0;\">Der Quantisierungs-Kernel war der Engpass, nicht das Netzwerk: Der Wechsel von Triton auf den Marlin-Kernel brachte allein Faktor 1,7 bis 4,2, mehr als jede Netzwerk- oder Parallelisierungs-Optimierung in diesem Test.<\/p>\n<\/div>\n\n\n\n<p class=\"wp-block-paragraph\">Der urspr\u00fcngliche Verdacht vor dem Test lautete, das InfiniBand-Kabel zwischen den Nodes sei der limitierende Faktor. Die Pipeline-Parallel-Konfiguration widerlegte das: Obwohl sie weniger Daten \u00fcber das Netzwerk schickt als Tensor-Parallel, war sie in jeder Lastsituation langsamer, weil die Rechenpausen zwischen den Nodes mehr kosten als das eingesparte Allreduce. Den gr\u00f6\u00dften Sprung brachte stattdessen der Kernel-Wechsel: Die offizielle vLLM-Anleitung f\u00fcr dieses Modell empfiehlt einen Triton-basierten Kernel, der f\u00fcr Hopper-GPUs optimiert ist [3]. Auf Ampere-Hardware bremst er dagegen aus: der Wechsel auf den handoptimierten Marlin-Kernel brachte allein Faktor 1,7 beim Einzelnutzer und Faktor 4,2 bei acht gleichzeitigen Anfragen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zwei weitere Software-Hebel verbesserten die Latenz f\u00fcr den Einzelnutzer: MTP Speculative Decoding l\u00e4sst das Modell zwei Tokens im Voraus raten und in einem Durchlauf pr\u00fcfen: stimmen die Vorhersagen, entstehen mehrere Tokens zum Preis von einem. Das verdoppelte die Einzelnutzer-Geschwindigkeit von 70 auf 109 tok\/s, belastete aber den Scheduler so stark, dass die Wartezeit ab 32 gleichzeitigen Anfragen auf \u00fcber 20 Sekunden anstieg. Erst Async Scheduling, der Scheduler plant den n\u00e4chsten Rechenschritt, w\u00e4hrend die GPUs noch arbeiten, l\u00f6ste diese Warteschlange wieder auf und lieferte mit 661 tok\/s bei 2,5 Sekunden Wartezeit den besten Gesamtwert des Tests.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Expert Parallel, bei dem ganze Experten statt Schichtscheiben auf einzelne Karten verteilt werden, brachte bei 32 Anfragen noch einen kleinen Vorteil, st\u00fcrzte aber bei 64 gleichzeitigen Anfragen mit einem Engine-Fehler ab. F\u00fcr den produktiven Multi-Node-Betrieb ist diese Konfiguration damit nicht geeignet.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Betriebsempfehlung f\u00fcr das 397B-Modell<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">F\u00fcr den produktiven Einsatz empfiehlt sich die Kombination aus Marlin-Kernel, MTP Speculative Decoding und Async Scheduling, im Testprotokoll als Konfiguration C gef\u00fchrt. Sie liefert 109 tok\/s f\u00fcr den Einzelnutzer bei rund einer Sekunde bis zum ersten Token, schneller als die meisten Cloud-APIs, und bleibt bis etwa 40 gleichzeitigen Sitzungen stabil nutzbar. Dar\u00fcber sollten Anfragen am Gateway gedrosselt statt direkt durchgereicht werden. Der Erst-Start des Modells dauert rund 15 Minuten f\u00fcr das Laden der Gewichte, danach lief das System im Test \u00fcber mehrere Stunden Benchmark-Last stabil.<\/p>\n\n\n\n<h2 id=\"das-schnelle-modell-qwen3-6-27b-im-dauerbetrieb\" class=\"wp-block-heading\">Das schnelle Modell: Qwen3.6-27B im Dauerbetrieb<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Qwen3.6-27B ist ein dichtes Modell ohne MoE-Architektur, mit 27 Milliarden Parametern, ebenfalls unter Apache-2.0-Lizenz und mit 262.000 Token Kontextfenster, im Test auf 64.000 Token konfiguriert. Die Gewichte in bf16 belegen rund 55 GB, ein einzelner 4-GPU-Node reicht f\u00fcr den vollst\u00e4ndigen Betrieb, Tensor-Parallel \u00fcber das Netzwerk war nicht n\u00f6tig. Beide Nodes liefen als unabh\u00e4ngige Endpunkte parallel.<\/p>\n\n\n\n<link href=\"https:\/\/fonts.googleapis.com\/css2?family=Manrope:wght@400;500;600;700;800&#038;display=swap\" rel=\"stylesheet\">\n\n<style>\n.itresell-price-table {\n  width: 100%;\n  border-collapse: collapse;\n  font-family: 'Manrope', -apple-system, sans-serif;\n  font-size: 0.91rem;\n  line-height: 1.55;\n  margin: 0.5rem 0 1rem;\n  border-radius: 10px;\n  overflow: hidden;\n  box-shadow: 0 2px 12px rgba(19,82,35,0.13);\n}\n.itresell-price-table thead tr { background: #135223; color: #fff; }\n.itresell-price-table thead th {\n  padding: 14px 18px;\n  text-align: left;\n  font-weight: 700;\n  font-size: 0.82rem;\n  letter-spacing: 0.04em;\n  border: none;\n  text-transform: uppercase;\n}\n.itresell-price-table tbody tr { background: #ffffff; }\n.itresell-price-table tbody td {\n  padding: 13px 18px;\n  border-bottom: 1px solid #c8e0c8;\n  vertical-align: top;\n  color: #1a1a1a;\n  background: #ffffff;\n}\n.itresell-price-table tbody td:first-child {\n  font-weight: 700;\n  background: #e8f6e9;\n}\n.itresell-price-table tbody tr:last-child td { border-bottom: none; }\n<\/style>\n\n<table class=\"itresell-price-table\">\n  <thead>\n    <tr>\n      <th>Parallel<\/th>\n      <th>1 Node tok\/s<\/th>\n      <th>TTFT<\/th>\n      <th>2 Nodes gesamt<\/th>\n      <th>Abweichung<\/th>\n    <\/tr>\n  <\/thead>\n  <tbody>\n    <tr>\n      <td>1<\/td>\n      <td>69<\/td>\n      <td>0,3 s<\/td>\n      <td>139<\/td>\n      <td>&lt; 1 %<\/td>\n    <\/tr>\n    <tr>\n      <td>8<\/td>\n      <td>459<\/td>\n      <td>0,7 s<\/td>\n      <td>924<\/td>\n      <td>&lt; 1 %<\/td>\n    <\/tr>\n    <tr>\n      <td>32<\/td>\n      <td>1.306<\/td>\n      <td>1,5 s<\/td>\n      <td>2.618<\/td>\n      <td>&lt; 1 %<\/td>\n    <\/tr>\n    <tr>\n      <td>64<\/td>\n      <td>2.093<\/td>\n      <td>2,6 s<\/td>\n      <td>4.192<\/td>\n      <td>&lt; 1 %<\/td>\n    <\/tr>\n    <tr>\n      <td>128<\/td>\n      <td>2.589<\/td>\n      <td>5,4 s<\/td>\n      <td>5.187<\/td>\n      <td>&lt; 1 %<\/td>\n    <\/tr>\n  <\/tbody>\n<\/table>\n\n\n\n<p class=\"wp-block-paragraph\">Die Ergebnisse zeigen nahezu perfekte lineare Skalierung: Was ein Node bei einer bestimmten Last leistet, verdoppelt sich mit dem zweiten Node fast exakt, die Abweichung zwischen beiden Nodes lag durchgehend unter einem Prozent. Bei 128 parallelen Anfragen pro Node erreichte das System 5.187 Tokens pro Sekunde Gesamtdurchsatz, wobei jeder einzelne Nutzer noch 23 tok\/s bei rund 5 Sekunden Wartezeit erlebte. Rund 250 gleichzeitige Sitzungen \u00fcber beide Nodes hinweg sind auf dieser Basis realistisch.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ohne Speculative Decoding erreichte ein einzelner Nutzer 69 tok\/s, langsamer als das 397B-Modell mit aktiviertem MTP, aber immer noch komfortabel f\u00fcr interaktiven Chat. Ein MTP-Testlauf f\u00fcr das 27B-Modell stand im dreit\u00e4gigen Testfenster zeitlich nicht mehr an; ein \u00e4hnlicher Geschwindigkeitsgewinn wie beim 397B-Modell w\u00e4re aber zu erwarten.<\/p>\n\n\n\n<h2 id=\"direkter-vergleich-397b-oder-27b-welches-modell-fuer-wen\" class=\"wp-block-heading\">Direkter Vergleich: 397B oder 27B, welches Modell f\u00fcr wen?<\/h2>\n\n\n\n<link href=\"https:\/\/fonts.googleapis.com\/css2?family=Manrope:wght@400;500;600;700;800&#038;display=swap\" rel=\"stylesheet\">\n\n<style>\n.itresell-price-table {\n  width: 100%;\n  border-collapse: collapse;\n  font-family: 'Manrope', -apple-system, sans-serif;\n  font-size: 0.91rem;\n  line-height: 1.55;\n  margin: 0.5rem 0 1rem;\n  border-radius: 10px;\n  overflow: hidden;\n  box-shadow: 0 2px 12px rgba(19,82,35,0.13);\n}\n.itresell-price-table thead tr { background: #135223; color: #fff; }\n.itresell-price-table thead th {\n  padding: 14px 18px;\n  text-align: left;\n  font-weight: 700;\n  font-size: 0.82rem;\n  letter-spacing: 0.04em;\n  border: none;\n  text-transform: uppercase;\n}\n.itresell-price-table tbody tr { background: #ffffff; }\n.itresell-price-table tbody td {\n  padding: 13px 18px;\n  border-bottom: 1px solid #c8e0c8;\n  vertical-align: top;\n  color: #1a1a1a;\n  background: #ffffff;\n}\n.itresell-price-table tbody td:first-child {\n  font-weight: 700;\n  background: #e8f6e9;\n}\n.itresell-price-table tbody tr:last-child td { border-bottom: none; }\n<\/style>\n\n<table class=\"itresell-price-table\">\n  <thead>\n    <tr>\n      <th>Kriterium<\/th>\n      <th>Qwen3.5-397B (Config C)<\/th>\n      <th>Qwen3.6-27B (2 Nodes)<\/th>\n    <\/tr>\n  <\/thead>\n  <tbody>\n    <tr>\n      <td>Maximaler Durchsatz<\/td>\n      <td>661 tok\/s<\/td>\n      <td>5.187 tok\/s<\/td>\n    <\/tr>\n    <tr>\n      <td>Einzelnutzer<\/td>\n      <td>109 tok\/s (mit MTP)<\/td>\n      <td>69 tok\/s (ohne MTP)<\/td>\n    <\/tr>\n    <tr>\n      <td>Nutzbare Parallelit\u00e4t<\/td>\n      <td>ca. 40 Sessions<\/td>\n      <td>ca. 250 Sessions<\/td>\n    <\/tr>\n    <tr>\n      <td>Durchsatz je GPU<\/td>\n      <td>83 tok\/s<\/td>\n      <td>648 tok\/s<\/td>\n    <\/tr>\n    <tr>\n      <td>Speicherbedarf<\/td>\n      <td>320 GB, beide Nodes<\/td>\n      <td>55 GB je Instanz<\/td>\n    <\/tr>\n    <tr>\n      <td>St\u00e4rke<\/td>\n      <td>Weltwissen, Vision, Multilingualit\u00e4t<\/td>\n      <td>Coding, Durchsatz, Kosten\/Token<\/td>\n    <\/tr>\n  <\/tbody>\n<\/table>\n\n\n\n<p class=\"wp-block-paragraph\">Auf identischer Hardware liefert das kleinere, dichte Modell knapp das Achtfache an Durchsatz bei sechsfacher nutzbarer Parallelit\u00e4t, aber mit deutlich schmalerem Weltwissen und ohne Vision-F\u00e4higkeiten. F\u00fcr Unternehmen mit hohem Nutzeraufkommen und klar umrissenen Aufgaben wie Coding-Assistenz, interner Dokumentensuche oder Kundensupport ist das 27B-Modell die wirtschaftlichere Wahl. Das 397B-Modell rechtfertigt sich dort, wo einzelne Anfragen von hoher Qualit\u00e4t, breitem Weltwissen oder Mehrsprachigkeit abh\u00e4ngen und die Nutzerzahl \u00fcberschaubar bleibt, etwa als internes Experten-Werkzeug f\u00fcr einige Dutzend Fachkr\u00e4fte statt als unternehmensweiter Chat-Ersatz.<\/p>\n\n\n\n<h2 id=\"energieverbrauch-was-ein-token-wirklich-kostet\" class=\"wp-block-heading\">Energieverbrauch: Was ein Token wirklich kostet<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">F\u00fcr das 27B-Modell wurde die GPU-Leistungsaufnahme w\u00e4hrend eines 32-fach parallelen Lastlaufs im Zwei-Sekunden-Raster gemessen. Im Leerlauf mit geladenem Modell zog ein Node rund 320 Watt, unter Volllast im Mittel 1.231 Watt und in der Spitze bis 1.605 Watt, bei einer maximalen GPU-Temperatur von 77 Grad. In 104 Sekunden erzeugte das System dabei 131.072 Tokens: 35,6 Wattstunden GPU-Energie f\u00fcr den gesamten Lauf, oder 0,27 Wattstunden je 1.000 erzeugte Tokens, umgerechnet rund 3,7 Millionen Tokens je Kilowattstunde GPU-Energie.<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><picture><source type=\"image\/webp\" srcset=\"https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-infografik-02-neu.webp 900w, https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-infografik-02-neu-300x200.webp 300w, https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-infografik-02-neu-768x512.webp 768w\" sizes=\"auto, (max-width: 900px) 100vw, 900px\"><img loading=\"lazy\" decoding=\"async\" width=\"900\" height=\"600\" src=\"https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-infografik-02-neu.png\" alt=\"Liniendiagramm Tokens pro Sekunde je Nutzer bei steigender Parallelit\u00e4t f\u00fcr 397B und 27B Modell\n\" class=\"wp-image-2644\" srcset=\"https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-infografik-02-neu.png 900w, https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-infografik-02-neu-300x200.png 300w, https:\/\/www.it-resell.com\/blog\/wp-content\/uploads\/2026\/09\/a100-gpu-server-llm-inferenz-infografik-02-neu-768x512.png 768w\" sizes=\"auto, (max-width: 900px) 100vw, 900px\" \/><\/picture><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Geschwindigkeit pro Nutzer: Mit steigender Parallelit\u00e4t sinkt die Einzelnutzer-Rate, bleibt beim 27B-Modell aber lange \u00fcber der Chat-Komfortgrenze von 10 tok\/s. (Quelle: IT-RESELL.COM)<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Beim 397B-Modell lag die Leistungsaufnahme in Stichproben bei 130 bis 200 Watt je GPU, deutlich niedriger als beim 27B-Modell, weil die Karten einen Gro\u00dfteil der Zeit auf Kommunikation und Dequantisierung warten, statt zu rechnen. Bei gleichzeitig rund einem Zehntel des Durchsatzes liegt die Energie je erzeugtem Token beim gro\u00dfen Modell grob beim Zehnfachen. Eine vollst\u00e4ndige Messreihe f\u00fcr das 397B-Modell konnte im Testfenster nicht mehr aufgenommen werden (siehe n\u00e4chster Abschnitt); die Gr\u00f6\u00dfenordnung ist damit als Anhaltspunkt zu verstehen, nicht als exakter Messwert.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">F\u00fcr die Kalkulation eines eigenen Servers z\u00e4hlt neben der GPU auch der Rest des Systems: CPU, RAM, L\u00fcfter und Netzteilverluste kommen bei einem vollausgestatteten Node unter Volllast mit weiteren 400 bis 600 Watt hinzu. Wer diese Zahlen einem TCO-Vergleich zwischen Neu- und Gebrauchtserver gegen\u00fcberstellt, sieht schnell, ab welchem Nutzungsvolumen sich die Anschaffung gegen\u00fcber laufenden Cloud-API-Kosten rechnet.<\/p>\n\n\n\n<div style=\"background:#f0f9f3;border-left:4px solid #70DE00;border-radius:6px;padding:16px 20px;margin:24px 0;font-family:Arial,sans-serif;color:#135223;line-height:1.5;font-size:14px;\">\n  <p style=\"margin:0;\">Ein dichtes 27B-Modell lieferte auf identischer Hardware das Achtfache an Durchsatz bei rund einem Zehntel der Energiekosten je Token: Modellgr\u00f6\u00dfe allein ist kein Qualit\u00e4tsma\u00df, wenn Durchsatz und Wirtschaftlichkeit z\u00e4hlen.<\/p>\n<\/div>\n\n\n\n<h2 id=\"was-in-der-praxis-schiefging-lessons-learned-fuer-den-produktivbetrieb\" class=\"wp-block-heading\">Was in der Praxis schiefging: Lessons Learned f\u00fcr den Produktivbetrieb<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ein Labortest ist nur so glaubw\u00fcrdig wie sein Umgang mit den eigenen Fehlern. Acht dokumentierte Vorf\u00e4lle bestimmten den zeitlichen Ablauf der drei Testtage und liefern f\u00fcr den Produktivbetrieb wertvollere Erkenntnisse als jede Erfolgsmeldung:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Nach jedem Reboot brauchte die erste GPU-Initialisierung auf den HGX-A100-Boards rund 60 Sekunden. Ohne Wartelogik lief der Container-Start in einen Timeout, bevor die Treiber bereit waren.<\/li>\n\n\n\n<li>Die IP-over-InfiniBand-Adressen waren zun\u00e4chst nur manuell gesetzt und fielen nach jedem Neustart aus, erst eine feste Netzplan-Konfiguration l\u00f6ste das dauerhaft.<\/li>\n\n\n\n<li>Der Modell-Download \u00fcber eine langsame Leitung brach mehrfach ab, unter anderem wegen eines fehlerhaften Xet-Backends; stabil lief es erst nach dessen Abschaltung und Verteilung der Gewichte per InfiniBand statt doppeltem Download.<\/li>\n\n\n\n<li>Eine zu gro\u00dfz\u00fcgige Kombination aus Batch-Gr\u00f6\u00dfe, MTP und CUDA-Graphs f\u00fchrte zu einem Speicher\u00fcberlauf im KV-Cache, behoben durch eine niedrigere Batch-Gr\u00f6\u00dfe und mehr Speicherreserve.<\/li>\n\n\n\n<li>Nach einem harten Container-Stopp blieb eine GPU als \u201ebelegt\u201c h\u00e4ngen und musste manuell freigegeben werden, ein sauberes Shutdown mit ausreichendem Timeout vermeidet das im Produktivbetrieb.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Von 23 durchgef\u00fchrten Pr\u00fcfungen bestanden 20 (sechs davon mit Einschr\u00e4nkung oder erst nach Korrektur), zwei schlugen endg\u00fcltig fehl (Pipeline-Parallel und Expert-Parallel unter Last), eine Messung entfiel wegen der h\u00e4ngenden GPU. F\u00fcr ein System, das drei Tage lang im Dauertest lief, ist das ein robustes Bild, vorausgesetzt, die dokumentierten Fallstricke sind vorher bekannt.<\/p>\n\n\n\n<h2 id=\"lohnt-sich-ein-a100-server-fuer-den-eigenen-ki-betrieb\" class=\"wp-block-heading\">Lohnt sich ein A100-Server f\u00fcr den eigenen KI-Betrieb?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Die Zahlen aus diesem Test beantworten die Ausgangsfrage klar: Eine vier Jahre alte GPU-Generation ohne FP8-Unterst\u00fctzung liefert mit dem richtigen Software-Stack noch immer produktionsreife Geschwindigkeiten, f\u00fcr ein 27B-Modell ebenso wie, mit Einschr\u00e4nkungen bei der Nutzerzahl, f\u00fcr ein aktuelles 397B-MoE-Modell. F\u00fcr Unternehmen mit planbar hohem Token-Volumen und Anforderungen an Datenschutz oder DSGVO-Konformit\u00e4t kann ein eigener Server damit wirtschaftlicher sein als eine dauerhafte Abh\u00e4ngigkeit von Cloud-APIs, insbesondere, weil sensible Unternehmensdaten das eigene Netz nie verlassen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Der Zugang zu genau dieser Hardware-Klasse ist dabei g\u00fcnstiger, als viele erwarten: HGX-A100-Systeme wie das getestete HPE Apollo 6500 kommen regelm\u00e4\u00dfig aus Leasing-R\u00fcckl\u00e4ufen, Rechenzentrums-Migrationen oder Insolvenzverfahren in den ITAD-Ankaufskanal, oft zu einem Bruchteil des urspr\u00fcnglichen Neupreises, bei vollst\u00e4ndiger technischer Pr\u00fcfung und zertifizierter Datenl\u00f6schung der Vorbesitzer-Daten. Wer sich n\u00e4her mit dem aktuellen Markt f\u00fcr KI-Server und GPU-Ankauf besch\u00e4ftigt oder generell GPU-, KI- und HPC-Server kaufen m\u00f6chte, findet dort auch abseits von A100-Systemen vergleichbare Sweet-Spots zwischen Preis und Leistung.<br>Ein Wermutstropfen bleibt: Ein solches System ist kein Plug-and-Play-Produkt. Die in diesem Test dokumentierten Stolperfallen, von der Kernel-Auswahl bis zur Netzwerk-Konfiguration, erfordern Ops-Wissen, das viele Unternehmen erst aufbauen oder einkaufen m\u00fcssen. Wer diese H\u00fcrde nimmt, bekommt daf\u00fcr eine Infrastruktur, die vollst\u00e4ndig im eigenen Haus bleibt und sich nach der Anschaffung nicht mehr nach Tokens abrechnet.<\/p>\n\n\n\n<h2 id=\"fazit\" class=\"wp-block-heading\">Fazit<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Drei Tage, zwei Server-Nodes, neun Benchmark-Reihen, und ein Ergebnis, das die Ausgangsfrage eindeutig beantwortet: Acht NVIDIA A100 GPUs ohne FP8-Unterst\u00fctzung sind 2026 keineswegs obsolet f\u00fcr den Betrieb gro\u00dfer Sprachmodelle. Mit dem richtigen Software-Stack lieferte das getestete HPE-Apollo-6500-System 109 Tokens pro Sekunde f\u00fcr den Einzelnutzer bei einem 397-Milliarden-Parameter-Modell und \u00fcber 5.000 Tokens pro Sekunde Gesamtdurchsatz bei einem schlanken 27-Milliarden-Parameter-Modell, Werte, die sich vor keiner aktuellen Cloud-API verstecken m\u00fcssen.<br>Die wichtigste Erkenntnis war dabei keine Hardware-, sondern eine Software-Frage: Der Wechsel eines einzelnen Quantisierungs-Kernels brachte mehr Durchsatz als jede Netzwerk- oder Parallelisierungs-Optimierung zusammen. Wer Ampere-Systeme mit den f\u00fcr Hopper optimierten Standardeinstellungen betreibt, verschenkt einen Gro\u00dfteil der vorhandenen Leistung, unabh\u00e4ngig davon, wie neu oder alt die GPUs tats\u00e4chlich sind.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">F\u00fcr die Kaufentscheidung hei\u00dft das: Ein A100 GPU-Server aus zweiter Hand ist eine ernstzunehmende Alternative zu Cloud-APIs, wenn das Nutzungsvolumen hoch genug ist und die Bereitschaft besteht, sich mit Kernel-Auswahl, Netzwerk-Konfiguration und den in diesem Test dokumentierten Betriebsfallen auseinanderzusetzen. Die Hardware selbst ist dabei selten der limitierende Faktor: wie dieser Test zeigt, ist es fast immer die Konfiguration dar\u00fcber.<br>Wer den vollst\u00e4ndigen Satz an Messwerten oder die reproduzierbare Konfiguration dieses Tests ben\u00f6tigt, findet die Eckdaten in den Kennzahlen und Quellen dieses Artikels.<\/p>\n\n\n\n<style>\n.itresell-cta {\n  display: flex;\n  flex-direction: column;\n  gap: 16px;\n  background: #eef6f1;\n  border: 1px solid #c8e6d0;\n  border-radius: 6px;\n  padding: 20px 28px;\n  margin: 32px 0;\n  box-sizing: border-box;\n}\n.itresell-cta strong { display: block; color: #174D28; font-size: inherit; font-weight: 700; margin-bottom: 3px; }\n.itresell-cta p { color: #555; font-size: inherit; line-height: 1.5; margin: 0; }\n.itresell-cta a.btn { display: inline-block; background: #174D28; color: #ffffff !important; font-weight: 700; font-size: inherit; padding: 11px 22px; border-radius: 5px; text-decoration: none !important; white-space: nowrap; align-self: flex-start; }\n@media (max-width: 600px) { .itresell-cta a.btn { width: 100%; text-align: center; box-sizing: border-box; } }\n<\/style>\n\n<div class=\"itresell-cta\">\n  <div>\n    <strong>Gebrauchte KI-Server mit NVIDIA-GPUs kaufen<\/strong>\n    <p>IT-RESELL bietet gepr\u00fcfte, getestete GPU-Server mit NVIDIA A100 und weiteren Datacenter-GPUs f\u00fcr LLM-Inferenz und KI-Workloads, inklusive Konfigurationsberatung und Garantie.<\/p>\n  <\/div>\n  <a class=\"btn\" href=\"https:\/\/www.it-resell.com\/page\/ki-server-kaufen\">Jetzt passenden KI-Server finden<\/a>\n<\/div>\n\n\n\n<div class=\"itr-sources\"><ol><li>[1] Hewlett Packard Enterprise (2024): QuickSpecs: HPE Apollo 6500 Gen10 Plus System. <a href=\"https:\/\/assets.ext.hpe.com\">assets.ext.hpe.com<\/a>, Zugriff: 14.09.2026<\/li><li>[2] NVIDIA (2021): NVIDIA A100 Tensor Core GPU, Datasheet. <a href=\"https:\/\/www.nvidia.com\">nvidia.com<\/a>, Zugriff: 14.09.2026<\/li><li>[3] vLLM Project (2026): GPTQModel-Quantisierung und Marlin-Kernel, Dokumentation. <a href=\"https:\/\/docs.vllm.ai\">docs.vllm.ai<\/a>, Zugriff: 14.09.2026<\/li><li>[4] Qwen Team \/ Alibaba Cloud (2026): Qwen3.5-397B-A17B, Model Card. <a href=\"https:\/\/huggingface.co\">huggingface.co<\/a>, Zugriff: 14.09.2026<\/li><li>Alle Benchmark-Zahlen in diesem Artikel stammen aus einem eigenen Labortest von IT-RESELL, durchgef\u00fchrt vom 9. bis 11.09.2026 auf firmeneigener Hardware.<\/li><\/ol><\/div>\n\n\n\n<p style=\"font-size:13px;color:#6b7280;margin:32px 0 20px;padding:14px 0;border-top:1px solid #e5e7eb;border-bottom:1px solid #e5e7eb;font-family:Arial,sans-serif;line-height:1.5;font-style:italic;\">\n  <strong style=\"color:#135223;font-style:normal;\">Hinweis zu diesem Beitrag:<\/strong> Inhalte auf diesem Blog werden mit Unterst\u00fctzung von KI-Tools erstellt und von unserem Redaktionsteam recherchiert, fachlich gepr\u00fcft und freigegeben.\n<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Nicht Datenbl\u00e4tter, sondern drei Tage echter Messwerte.<\/p>\n","protected":false},"author":3,"featured_media":2176,"comment_status":"closed","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"tier":"","cluster":"","pillar_of":"","_itr_author_alias":"steffen-huntscha","_itr_post_quote":"","_itr_meta_title":"A100 GPU-Server f\u00fcr LLM-Inferenz | IT-RESELL","_itr_meta_desc":"A100 GPU-Server f\u00fcr LLM-Inferenz nutzen \u2713 echte Benchmark-Zahlen aus dem Labortest \u2713 bis 5.187 tok\/s Durchsatz \u25ba Jetzt bei IT-RESELL anfragen!","_itr_focus_kw":"A100 GPU-Server","_itr_hero_img":2117,"footnotes":""},"categories":[7],"tags":[167,618,103,1164,1169,52,1166,1163,1168,1165,1172,1170,1171,44,1167],"produktbereich":[],"hersteller":[290,294,1159],"produkttyp":[367,368,312],"thema":[1161,302,1160,1162],"class_list":["post-2634","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-it-kaufberatung","tag-gebrauchte-server","tag-gpu-ankauf","tag-gpu-server","tag-hpe-apollo-6500","tag-infiniband","tag-ki-server","tag-llm-inferenz","tag-nvidia-a100","tag-on-premise-ki","tag-proliant-xl645d","tag-quantisierung","tag-qwen3-5","tag-qwen3-6","tag-server-kaufberatung","tag-vllm"],"_links":{"self":[{"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/posts\/2634","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/users\/3"}],"replies":[{"embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/comments?post=2634"}],"version-history":[{"count":5,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/posts\/2634\/revisions"}],"predecessor-version":[{"id":2647,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/posts\/2634\/revisions\/2647"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/media\/2176"}],"wp:attachment":[{"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/media?parent=2634"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/categories?post=2634"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/tags?post=2634"},{"taxonomy":"produktbereich","embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/produktbereich?post=2634"},{"taxonomy":"hersteller","embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/hersteller?post=2634"},{"taxonomy":"produkttyp","embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/produkttyp?post=2634"},{"taxonomy":"thema","embeddable":true,"href":"https:\/\/www.it-resell.com\/blog\/wp-json\/wp\/v2\/thema?post=2634"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}