<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Ai-Inference on Ilscipio - Enterprise Commerce Experten</title>
    <link>https://www.ilscipio.com/tags/ai-inference/</link>
    <description>Recent content in Ai-Inference on Ilscipio - Enterprise Commerce Experten</description>
    <generator>Hugo</generator>
    <language>de-DE</language>
    <lastBuildDate>Fri, 28 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://www.ilscipio.com/tags/ai-inference/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Lokale KI vs. Cloud APIs - wann was Sinn ergibt</title>
      <link>https://www.ilscipio.com/blog/local-ai-vs-cloud-apis/</link>
      <pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/local-ai-vs-cloud-apis/</guid>
      <description>&lt;p&gt;Ich betreibe lokale Modelle auf eigener Hardware für manche Aufgaben und Cloud APIs für andere. Man fragt mich, was besser ist, als wäre das eine philosophische Frage. Ist es nicht. Es ist eine Kosten- und Latenzfrage, und die Antwort hängt davon ab, was man damit macht.&lt;/p&gt;&#xA;&lt;h2 id=&#34;wann-lokal-sinn-ergibt&#34;&gt;Wann lokal Sinn ergibt&lt;/h2&gt;&lt;p&gt;Wenn man eine Aufgabe hat, die tausende Male am Tag läuft, mit kurzen Inputs und vorhersagbaren Outputs - Klassifikation, Extraktion, einfaches Q&amp;amp;A - ist ein lokales Modell günstiger. Man zahlt die Hardware einmal (oder mietet eine dedizierte GPU) und schickt so viele Requests, wie man will. Keine Per-Token-Abrechnung, keine Rate Limits, keine Abhängigkeit von der Uptime eines Dritten.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Ich habe einen Monat lang nicht auf meine AI-Inference-Rechnung geschaut</title>
      <link>https://www.ilscipio.com/blog/real-cost-ai-inference/</link>
      <pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/real-cost-ai-inference/</guid>
      <description>&lt;p&gt;Ich betreibe einen Service, der AI-Inference zur günstigsten verfügbaren GPU routet. Daher verbringe ich unverhältnismäßig viel Zeit damit, auf Preis-Dashboards von Anbietern zu starren. Und was ich dabei immer wieder lerne: Der Listenpreis eines AI-Modells sagt dir fast nichts darüber, was Inference dich tatsächlich kostet.&lt;/p&gt;&#xA;&lt;p&gt;Nehmen wir ein 70B-Parameter-Modell. Anbieter A verlangt $0,60 pro Million Input-Tokens. Anbieter B verlangt $0,90. Anbieter A ist günstiger, oder?&lt;/p&gt;&#xA;&lt;p&gt;Nicht unbedingt. Anbieter A hat Cold Starts, die 3-8 Sekunden zum ersten Request addieren. Anbieter B hält Models warm. Anbieter A stellt Requests zu Spitzenzeiten in eine Warteschlange - deine p95-Latenz springt auf 30 Sekunden. Anbieter B nicht. Wenn du einen Chatbot betreibst, bedeuten diese Cold Starts direkt, dass User den Tab schließen.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
