Wir verfolgen ja laufend KI-Modellverbesserungen. Ein Wettrennen der Superlative, dass zunehmend Terrabytes an RAM benötigt. Das aktuell top open-weights Modell Kimi K3 hat 2.8T Parameter, d.h. bei fp16 wären das 5.6 TB ultraschnelles RAM fürs Modell laden alleine. Dazu kommen die nötigen KV-Caches,… mit nochmals RAM-Bedarf. OpenAI, Anthropic,… Top-Modelle sind gerüchteweise noch größer. Ein verrücktes, und für die meisten Anwendungen sinnloses Wettrennen.
Die KI-Modelle sind aber „nackt“ nicht gut anwendbar. Moderne ChatBots (wie das aktuelle ChatGPT/Claude/…) und Agenten (wie Codex/Claude-Code/OpenCLaw/…) bedienen sich zunehmend ausgefeilter Rahmenprogramme ("Harness"es), um deren KI-Modelle besser anwendbar zu machen. Diese umfassen nicht nur die Möglichkeit Werkzeugaufrufe durchzuführen sondern auch Wissensdatenbanken (RAG,…), etc. Vor allem die Wisensdatenbanken, welche ein nichtflüchtiges Gedächtnis über die jeweiligen Benutzer aufbauen, sind sehr wertvoll. Daneben gibt es aber auch - zumeist in menschlicher Sprache geschriebene - Arbeitsanweisungen für diese komplexere KI.
Wie viel besser ist eine solche KI mit „Harness“, als das generische Modell? Mein persönliches Beispiel ist die Antwort auf die „Waschstraßenfrage“ (I want to go to a car-wash to wash my car, and its 50 meters away, should I drive or walk?). Mein OpenClaw als KI+Harness antwortete für mich perfekt, kurz, prägnant (Drive. It’s a car wash — you need the car there.
). Aber das KI-Modell alleine hat dafür intern mehrere Anfragen und seitenlangen Text generiert. Die Antwort des KI-Modells alleine wäre für mich ziemlich schlechte Qualität.
Damit die Frage - wieviel „Anwendungsintelligenz“ ist im KI-Harness, und wieviel im KI-Modell. Eine gute erste Antwort ist in diesem noch nicht überprüften Paper, das im Video https://www.youtube.com/watch?v=ro5FHh_voqk vorgestellt wird. Netto: Ein guter „Harness“ mit einem der aktuellen Top-Modelle erzielte über 90% beim extrem schwierigen ARC-AGI-3 Test, während die KI-Modelle mit dem Minimalharness der Hersteller noch unter 10% sind.
Es bestätigt damit meine persönliche Erfahrung und aktuelle Vorgehensweise. Ich versuche einen völlig lokalen, vertraulichen KI-Agenten mit viel spezifischem Wissen über mich und meine Umgebung aufzubauen. Mit keinem teuren Spitzen KI-Modell, sondern einem, welches gerade noch in den ca. 230GB RAM meines Clusters vernünftig ausgeführt werden kann. Und mit einem sich damit aufbauenden „Harness“.
Meine Vorteile:
-
Unabhängigkeit vom KI-Anbieter - sollte ich von einer KI zur anderen wechseln wollen, ists einfach. Ich habe keinen „lock-in“ meines Harness-Wissens in OpenAI oder Anthropic oder …
-
Privatsphäre - meine Informationen sind bei mir. Und meine Wissensdatenbank (bei mir als interne Wiki) ist auch intern nach Vertraulichkeitsgrad gekennzeichnet (Persönlich, Familie, Firma, Allgemein)
Nachteile:
- Kosten - für den KI-Modell Server (bei mir eben 2x DGX Spark mit 2x 128GB RAM, um ein GPT-4.x qualitätsähnliches Modell lokal laufen zu lassen) den Harness (einen MacMini, für eine kleine KI mit Spracherkennung, OCR, Bildverständnis, KI-Suche, sowie einer Not-KI, falls der Cluster offline ist, und dem OpenClaw Agenten mit Wiki,…) - insgesamt aktuell im Bereich EUR 10k. Theoretisch wird das jährlich dramatisch billiger/besser, praktisch gibts aber die RAM,… Krise mit steigenden Preisen.
- Zeitaufwand / Lehrgeld - ich bin halt ein Innovator und zahl’ immer drauf.
Aktuell arbeite ich eben daran, meine Umgebung zu stabilisieren und Erfahrungen zu sammeln. Ich möchte zunehmend chatGPT, Claude und Co nurmehr wenn unbedingt nötig verwenden, und mir das „was“ dafür von meinem eigenen OpenClaw (AndiClaw) gut vorbereiten lassen. Und die lokale KI auch zunehmend in all meine Alltagsanwendungen integrieren (VSCode,…).