<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>AI on Ilscipio - Enterprise Commerce Experten</title>
    <link>https://www.ilscipio.com/categories/ai/</link>
    <description>Recent content in AI on Ilscipio - Enterprise Commerce Experten</description>
    <generator>Hugo</generator>
    <language>de-DE</language>
    <lastBuildDate>Fri, 28 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://www.ilscipio.com/categories/ai/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Lokale KI vs. Cloud APIs - wann was Sinn ergibt</title>
      <link>https://www.ilscipio.com/blog/local-ai-vs-cloud-apis/</link>
      <pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/local-ai-vs-cloud-apis/</guid>
      <description>&lt;p&gt;Ich betreibe lokale Modelle auf eigener Hardware für manche Aufgaben und Cloud APIs für andere. Man fragt mich, was besser ist, als wäre das eine philosophische Frage. Ist es nicht. Es ist eine Kosten- und Latenzfrage, und die Antwort hängt davon ab, was man damit macht.&lt;/p&gt;&#xA;&lt;h2 id=&#34;wann-lokal-sinn-ergibt&#34;&gt;Wann lokal Sinn ergibt&lt;/h2&gt;&lt;p&gt;Wenn man eine Aufgabe hat, die tausende Male am Tag läuft, mit kurzen Inputs und vorhersagbaren Outputs - Klassifikation, Extraktion, einfaches Q&amp;amp;A - ist ein lokales Modell günstiger. Man zahlt die Hardware einmal (oder mietet eine dedizierte GPU) und schickt so viele Requests, wie man will. Keine Per-Token-Abrechnung, keine Rate Limits, keine Abhängigkeit von der Uptime eines Dritten.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Ich habe einen Monat lang nicht auf meine AI-Inference-Rechnung geschaut</title>
      <link>https://www.ilscipio.com/blog/real-cost-ai-inference/</link>
      <pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/real-cost-ai-inference/</guid>
      <description>&lt;p&gt;Ich betreibe einen Service, der AI-Inference zur günstigsten verfügbaren GPU routet. Daher verbringe ich unverhältnismäßig viel Zeit damit, auf Preis-Dashboards von Anbietern zu starren. Und was ich dabei immer wieder lerne: Der Listenpreis eines AI-Modells sagt dir fast nichts darüber, was Inference dich tatsächlich kostet.&lt;/p&gt;&#xA;&lt;p&gt;Nehmen wir ein 70B-Parameter-Modell. Anbieter A verlangt $0,60 pro Million Input-Tokens. Anbieter B verlangt $0,90. Anbieter A ist günstiger, oder?&lt;/p&gt;&#xA;&lt;p&gt;Nicht unbedingt. Anbieter A hat Cold Starts, die 3-8 Sekunden zum ersten Request addieren. Anbieter B hält Models warm. Anbieter A stellt Requests zu Spitzenzeiten in eine Warteschlange - deine p95-Latenz springt auf 30 Sekunden. Anbieter B nicht. Wenn du einen Chatbot betreibst, bedeuten diese Cold Starts direkt, dass User den Tab schließen.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Wie aus einer Tabelle ein AI-Inference-Router wurde</title>
      <link>https://www.ilscipio.com/blog/route-ai-cheapest-gpu/</link>
      <pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/route-ai-cheapest-gpu/</guid>
      <description>&lt;p&gt;Ich bin eher zufällig auf Spot-Pricing für AI-Compute gestoßen. Und habe dann natürlich einen Service daraus gebaut.&lt;/p&gt;&#xA;&lt;p&gt;Die Kurzfassung: GPU-Preise schwanken enorm zwischen Anbietern. Gleiches Modell, gleicher Output, unterschiedliche Kosten je nach Zeitpunkt und Anbieter. Eine H100 kostet bei einem Anbieter gerade $2,10/Stunde. Dieselbe GPU bei einem anderen: $3,80/Stunde. Morgen sehen die Zahlen wieder anders aus.&lt;/p&gt;&#xA;&lt;p&gt;Das habe ich auf die harte Tour gelernt. Ich hatte AIVory Guard bei einem einzelnen Anbieter laufen, den ich ausgewählt hatte, weil er zum Zeitpunkt meiner Recherche am günstigsten war. Einen Monat später war die Rechnung 40% höher als erwartet. Die Preise hatten sich verschoben und ich hatte es nicht gemerkt.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Ich habe fünf API-Wrapper durch MCP ersetzt - an einem Wochenende</title>
      <link>https://www.ilscipio.com/blog/mcp-servers-practical-guide/</link>
      <pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/mcp-servers-practical-guide/</guid>
      <description>&lt;p&gt;Die erste Hälfte von 2025 habe ich damit verbracht, Custom-API-Wrapper zu schreiben, damit KI-Modelle mit unseren internen Tools reden können. Ein Wrapper für die Marketing-API, einer für das Sales Dashboard, einer für die JetBrains Marketplace Stats, zwei weitere für Deployment-Skripte. Jeder Wrapper war ein bisschen anders. Jeder ging kaputt, wenn sich die API des Tools änderte. Und jedes Mal, wenn ich einen neuen KI-Client anbinden wollte, musste ich die Integration nochmal schreiben.&lt;/p&gt;</description>
    </item>
    <item>
      <title>Eine SQL Injection kam durch zwei Code Reviews</title>
      <link>https://www.ilscipio.com/blog/ai-code-review-in-ide/</link>
      <pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://www.ilscipio.com/blog/ai-code-review-in-ide/</guid>
      <description>&lt;p&gt;Letzten Monat hat ein Junior-Entwickler bei einem Kundenprojekt eine SQL-Abfrage gepusht, die User-Input direkt in die WHERE-Klausel konkatenierte. Klassische Injection. Der Pull Request hatte zwei Approvals von Senior Engineers. Niemandem ist es aufgefallen.&lt;/p&gt;&#xA;&lt;p&gt;Das ist nicht ungewöhnlich. Code Review fängt Logik-Bugs, Style-Verstöße, fehlende Tests. Bei Security-Patterns ist es nicht gut. Reviewer scannen nach Intent und Korrektheit - macht dieser Code, was er soll. Sie laufen nicht die OWASP-Kategorien im Kopf durch, während sie einen Diff lesen.&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
