23.06.26
Ich habe mich mit Gemini und Copilot über die Hermes-Entwicklung und die geschichtliche Einordnung unterhalten und diesen, mehrfach revidierten Report erstellen lassen.
Die Quellenangaben sind meines Erachtens korrekt.
Falls die PDF nicht sauber angezeigt wird, hier noch einmal das html-Pendant.
Leider fehlen die schönen Grafiken.
Die Idee, KIs nicht nur Entscheidungen berechnen, sondern autonome Zielverfolgungen durchführen zu lassen, reicht bis in die Frühzeit der Informatik zurück. Lange vor großen Sprachmodellen etablierte die akademische Forschung fundamentale Architekturen für Handlungsplanung.
Fokus auf deterministische Logik, Expertensysteme und Suchalgorithmen. Frühe Kognitionsarchitekturen wie SOAR und ACT-R versuchten, menschliches Problemlösungsverhalten durch geschlossene Symbolverarbeitung nachzubilden.
Formalisierung durch Rao & Georgeff. Das BDI-Paradigma beschrieb Agenten über ihre Überzeugungen (Beliefs), Wünsche (Desires) und Absichten (Intentions). Es bildet bis heute ein fundamentales theoretisches Fundament der Multi-Agenten-Theorie.
Mit dem Durchbruch neuronaler Netze änderte sich der Ansatz von starren Regeln hin zu lernenden Systemen. Die Einführung transformativer Sprachmodelle bildete schließlich das Rückgrat für moderne LLM-Agenten.
AlphaGo demonstriert eindrucksvoll die Kombination aus Deep Reinforcement Learning (RL), Supervised Learning und Monte-Carlo Tree Search (MCTS) zur Lösung hochkomplexer Entscheidungsprobleme.
Vaswani et al. führen die Transformer-Architektur ein. Mit GPT-3 (2020) wird deutlich, dass großskalierte Sprachmodelle über beeindruckendes In-Context-Learning verfügen.
Das Paper „ReAct: Synergizing Reasoning and Acting in Language Models“ (Yao et al.) verbindet gedankliche Planung (Reasoning) mit der Ausführung von Aktionen (Acting) über externe Schnittstellen.
Community-Projekte wie AutoGPT und BabyAGI erzeugen enormen Hype um autonome Schleifen. OpenAI reagiert im Juni 2023 mit nativem Function Calling in GPT-4 API.
Ab Ende 2024 wandelten sich KI-Agenten von experimentellen Skripten zu verlässlichen Industriewerkzeugen mit graphischer Computerbedienung und standardisierten Schnittstellen.
Mit Claude 3.5 Sonnet lernt ein KI-Modell erstmals nativ, den Bildschirminhalt visuell zu interpretieren, den Mauszeiger zu steuern und Tastatureingaben auf beliebigen Softwareoberflächen auszuführen.
Anthropic stellt MCP als offenes Protokoll bereit, um isolierte Datenquellen, Datenbanken und lokale Entwicklungsumgebungen standardisiert an Agenten anzubinden.
Mit Systemen wie OpenAI Operator und Google Gemini Computer Use ziehen autonome Agenten tief in Webbrowser und Cloud-Arbeitsumgebungen ein.
Parallel zur Entwicklung proprietärer Schnittstellen entwickelte sich im Open-Source-Ökosystem eine starke Bewegung zur Lokalisierung agentischer Systeme. Anstatt sensible Daten über Cloud-APIs zu schicken, ermöglichen lokal ausführbare Modelle vollständige Kontrolle über Daten und Ausführung.
Am 25. Februar 2026 veröffentlichte das Forschungskollektiv Nous Research das **Hermes Agent** Framework unter der freien MIT-Lizenz.
Hermes kombiniert fortschrittliches Agentic Fine-Tuning mit optimierter Befehlstreue für komplexe Werkzeugschleifen. Dadurch können hochleistungsfähige Agenten ohne Cloud-Gebühren lokal auf eigener Hardware betrieben werden.
One thought on “Die Evolution agentischer KI-Systeme”