<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Smart-Inference on Ilscipio - Enterprise Commerce Experten</title>
    <link>https://www.ilscipio.com/tags/smart-inference/</link>
    <description>Recent content in Smart-Inference on Ilscipio - Enterprise Commerce Experten</description>
    <generator>Hugo</generator>
    <language>de-DE</language>
    <lastBuildDate>Tue, 18 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://www.ilscipio.com/tags/smart-inference/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Ich habe einen Monat lang nicht auf meine AI-Inference-Rechnung geschaut</title>
      <link>https://www.ilscipio.com/blog/real-cost-ai-inference/</link>
      <pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/real-cost-ai-inference/</guid>
      <description>&lt;p&gt;Ich betreibe einen Service, der AI-Inference zur günstigsten verfügbaren GPU routet. Daher verbringe ich unverhältnismäßig viel Zeit damit, auf Preis-Dashboards von Anbietern zu starren. Und was ich dabei immer wieder lerne: Der Listenpreis eines AI-Modells sagt dir fast nichts darüber, was Inference dich tatsächlich kostet.&lt;/p&gt;&#xA;&lt;p&gt;Nehmen wir ein 70B-Parameter-Modell. Anbieter A verlangt $0,60 pro Million Input-Tokens. Anbieter B verlangt $0,90. Anbieter A ist günstiger, oder?&lt;/p&gt;&#xA;&lt;p&gt;Nicht unbedingt. Anbieter A hat Cold Starts, die 3-8 Sekunden zum ersten Request addieren. Anbieter B hält Models warm. Anbieter A stellt Requests zu Spitzenzeiten in eine Warteschlange - deine p95-Latenz springt auf 30 Sekunden. Anbieter B nicht. Wenn du einen Chatbot betreibst, bedeuten diese Cold Starts direkt, dass User den Tab schließen.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Wie aus einer Tabelle ein AI-Inference-Router wurde</title>
      <link>https://www.ilscipio.com/blog/route-ai-cheapest-gpu/</link>
      <pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/route-ai-cheapest-gpu/</guid>
      <description>&lt;p&gt;Ich bin eher zufällig auf Spot-Pricing für AI-Compute gestoßen. Und habe dann natürlich einen Service daraus gebaut.&lt;/p&gt;&#xA;&lt;p&gt;Die Kurzfassung: GPU-Preise schwanken enorm zwischen Anbietern. Gleiches Modell, gleicher Output, unterschiedliche Kosten je nach Zeitpunkt und Anbieter. Eine H100 kostet bei einem Anbieter gerade $2,10/Stunde. Dieselbe GPU bei einem anderen: $3,80/Stunde. Morgen sehen die Zahlen wieder anders aus.&lt;/p&gt;&#xA;&lt;p&gt;Das habe ich auf die harte Tour gelernt. Ich hatte AIVory Guard bei einem einzelnen Anbieter laufen, den ich ausgewählt hatte, weil er zum Zeitpunkt meiner Recherche am günstigsten war. Einen Monat später war die Rechnung 40% höher als erwartet. Die Preise hatten sich verschoben und ich hatte es nicht gemerkt.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
