Skip to Content

Harness Engineering (2/5): Wie Tools gestaltet sein müssen, damit KI Agenten sie richtig einsetzen

am September 29, 2026 von
Harness Engineering (2/5): Wie Tools gestaltet sein müssen, damit KI Agenten sie richtig einsetzen
Minh Hieu Le

Sobald ein KI-Agent selbst Aufgaben ausführt, braucht er dafür Tools. Über diese Tools kann er zum Beispiel auf das CRM, die Dokumentenablage, den Kalender oder das Ticketsystem zugreifen und dort Aufgaben erledigen. Viele dieser Systeme bieten bereits technische Schnittstellen, über die andere Software auf ihre Funktionen zugreifen kann. Daher liegt es nahe, diese bestehenden Schnittstellen auch einem KI-Agenten zur Verfügung zu stellen. In der Praxis führt dieser direkte Ansatz jedoch häufig zu Problemen. Denn die Schnittstellen wurden für klassische Software und Entwickler entwickelt – nicht dafür, dass ein KI-Agent selbstständig entscheidet, wann und wie er sie einsetzen soll.  

Im ersten Teil dieser Reihe ging es um Context Engineering, also um die Frage, welche Informationen ein Agent zu welchem Zeitpunkt benötigt. Doch Informationen allein reichen nicht aus. Sobald ein Agent selbst handeln soll, kommt es auch darauf an, welche Werkzeuge ihm dafür zur Verfügung stehen und wie diese gestaltet sind. Genau damit beschäftigt sich Tool Engineering. Es ist Teil des Harness, also der Infrastruktur rund um einen Agenten, die seine zuverlässige Arbeit im Alltag unterstützt.

In diesem Beitrag zeigen wir, worin sich ein Tool für KI-Agenten von einer klassischen technischen Schnittstelle unterscheidet, wie solche Tools gestaltet und beschrieben sein sollten und wie sich ihre Qualität im Betrieb messen lässt.

Technische Schnittstellen müssen für KI-Agenten als Tools neu gedacht werden

Eine klassische Schnittstelle ist für einen klar definierten technischen Ablauf ausgelegt: Eine Software sendet bestimmte Angaben und erhält das dafür vorgesehene Ergebnis zurück. Bei einem KI-Agenten ist das anders. Er muss zunächst selbst entscheiden, welches Werkzeug zu seiner Aufgabe passt und wie er es einsetzen soll. Dabei kann er ein Werkzeug auch falsch auswählen, seinen Zweck missverstehen oder unpassende Angaben übermitteln.

Ein Tool für KI-Agenten muss deshalb so gestaltet sein, dass der Agent möglichst eindeutig erkennt, wann und wie er es verwenden soll. Ausgangspunkt sind dabei nicht die einzelnen Funktionen, die ein System technisch zur Verfügung stellt, sondern die Aufgaben, die der Agent erledigen soll. Entscheidend ist also die Frage: Welche Handlung soll der Agent ausführen können und welche Informationen braucht er, um das passende Werkzeug richtig einzusetzen?

Anthropic beschreibt Tools deshalb als eine eigene Form von Software, für deren Gestaltung andere Anforderungen gelten als für klassische Schnittstellen. Eine hilfreiche Faustregel lautet: Ein gutes Tool sollte so eindeutig aufgebaut und beschrieben sein, dass auch eine neue Kollegin am ersten Arbeitstag damit zurechtkäme – ohne zusätzliches Vorwissen oder Rückfragen.

Tools müssen sich an Aufgaben statt an Systemen orientieren

Wie ein Tool aufgebaut sein sollte, lässt sich gut am Beispiel einer Terminvereinbarung zeigen. Dafür sind mehrere Schritte nötig: Eine Person muss gefunden, ihr Kalender abgefragt, freie Zeiten müssen verglichen, der Termin angelegt und die Einladung verschickt werden. Werden diese einzelnen Funktionen jeweils als eigenes Tool bereitgestellt, muss der Agent selbst entscheiden, welche davon er benötigt und in welcher Reihenfolge er sie aufruft. Das macht den Ablauf aufwendiger und erhöht mit jedem zusätzlichen Schritt die Möglichkeit für Fehler.

Einfacher und zuverlässiger ist es, diese Schritte in einem Tool „Termin vereinbaren“ zusammenzufassen. Der Agent gibt dann nur den Auftrag, einen Termin zu vereinbaren. Das Tool übernimmt die notwendigen Einzelschritte im Hintergrund und gibt anschließend das Ergebnis zurück. So muss der Agent weniger Schritte selbst koordinieren und es gelangen weniger Zwischeninformationen in seinen Kontext (Abbildung 1).

Abbildung 1: Verteilung der Koordinationsarbeit zwischen Agent und Tool bei zwei unterschiedlichen Ansätzen

Daraus ergeben sich folgende Leitlinien:

  • Schneiden Sie Tools so zu, wie ein Mensch die Aufgabe aufteilen würde, und nicht so, wie das Quellsystem aufgebaut ist.
  • Halten Sie die Zahl der Tools klein. Je mehr Werkzeuge zur Auswahl stehen und je ähnlicher sie einander sind, desto unsicherer wird die Wahl des richtigen Werkzeugs.
  • Machen Sie die Herkunft im Namen sichtbar. „Kunde im CRM suchen“ und „Vorgang im Ticketsystem suchen“ sind eindeutig, zweimal „Suchen“ ist es nicht. Gleich benannte Werkzeuge aus verschiedenen Quellsystemen gehören zu den häufigsten Fehlerquellen überhaupt.

Ein Tool kann dabei mehrere Schritte bündeln. Genau das ist der Zweck: Aufgaben, die der Agent sonst einzeln ausführen müsste, übernimmt das Tool im Hintergrund.

Fünf Aspekte entscheiden darüber, ob ein Agent ein Tool richtig einsetzen kann

Damit ein Agent ein Tool zuverlässig einsetzen kann, muss für ihn eindeutig sein, wofür es gedacht ist, wann er es verwenden soll, welche Angaben es benötigt, welches Ergebnis es liefert und was im Fehlerfall zu tun ist (Abbildung 2). Diese Informationen werden bei der Gestaltung von Tools jedoch häufig nicht ausreichend berücksichtigt.

Abbildung 2: Fünf zentrale Informationen zu einem Tool und die Folgen, wenn sie fehlen

  1. Name: Der Name sollte eindeutig sein und erkennen lassen, wofür das Tool zuständig ist und aus welchem System es stammt. So kann der Agent leichter das passende Tool auswählen.
  2. Beschreibung: Die Beschreibung erklärt dem Agenten, was das Tool leistet und wofür es eingesetzt werden soll. Sie sollte auch deutlich machen, was das Tool nicht leistet, und ein Beispiel für die richtige Verwendung enthalten. Schon kleine Präzisierungen können dazu beitragen, dass der Agent häufiger das richtige Tool auswählt.
  3. Benötigte Angaben (Parameter): Es muss eindeutig festgelegt sein, welche Angaben das Tool benötigt und in welchem Format. „Kundennummer“ ist beispielsweise eindeutig. „Kunde“ lässt dagegen offen, ob eine Nummer, ein Name oder ein ganzer Datensatz gemeint ist.
  4. Ergebnis: Das Tool sollte nur die Informationen zurückgeben, die der Agent für den nächsten Schritt benötigt, und zwar in einer verständlichen Form. Ein Kundenname ist beispielsweise leichter zu verarbeiten als eine lange technische Kennung. Bei größeren Datenmengen helfen Obergrenzen, Filter oder eine portionsweise Ausgabe dabei, die Rückgabe auf das Wesentliche zu begrenzen.
  5. Fehlermeldung: Wenn ein Aufruf nicht funktioniert, muss der Agent erkennen können, was schiefgegangen ist und was er als Nächstes tun soll. Warum das für die Zuverlässigkeit besonders wichtig ist, zeigt der nächste Abschnitt.

Gerade die Rückgabe eines Tools hat außerdem direkten Einfluss auf den Kontext des Agenten. Gibt ein Tool einen vollständigen Datensatz zurück, obwohl nur drei Angaben benötigt werden, gelangen unnötige Informationen in den Kontext. Das erschwert dem Agenten die folgenden Schritte und kann deren Qualität beeinträchtigen.

Gute Fehlermeldungen helfen Agenten, Fehler selbst zu korrigieren

Wenn ein Tool-Aufruf fehlschlägt, muss der Agent aus der Fehlermeldung erkennen können, was schiefgegangen ist und wie er darauf reagieren soll. Eine gute Fehlermeldung beschreibt deshalb nicht nur den Fehler, sondern gibt dem Agenten die Informationen, die er für einen neuen Versuch benötigt.

Das zeigt sich an einem einfachen Beispiel (Abbildung 3): Die Meldung „Ungültige Anfrage“ hilft dem Agenten nicht weiter, weil unklar bleibt, was er ändern muss. Die Meldung „Der angefragte Zeitraum ist zu groß. Bitte fragen Sie höchstens 30 Tage auf einmal ab“ erklärt dagegen sowohl das Problem als auch die Lösung. Der Agent kann seine Anfrage entsprechend anpassen und es erneut versuchen – ohne dass ein Mensch eingreifen muss.

Abbildung 3: Verlauf eines fehlgeschlagenen Aufrufs bei nicht verwertbarer und bei anleitender Fehlermeldung

Kann der Agent einen Fehler auf diese Weise selbst korrigieren, muss der Vorgang nicht abgebrochen und von einem Mitarbeiter übernommen werden. Das gleiche Prinzip gilt, wenn ein Tool beispielsweise zu viele Ergebnisse findet und seine Antwort begrenzen muss. Statt die Ausgabe unbemerkt zu kürzen, sollte es den Agenten darauf hinweisen und erklären, wie er seine Anfrage weiter eingrenzen kann.

Fehlermeldungen sollten dem Agenten daher drei Dinge vermitteln: was nicht funktioniert hat, warum es nicht funktioniert hat und was er als Nächstes tun kann.

Tool-Qualität lässt sich im Einsatz messen

Ob ein Tool gut gestaltet ist, zeigt sich vor allem daran, wie zuverlässig ein Agent damit arbeitet. Dafür sollte der Agent mit realistischen Aufgaben getestet und anschließend ausgewertet werden, an welchen Stellen Probleme auftreten. Anthropic empfiehlt insbesondere Tests, bei denen mehrere Tools nacheinander eingesetzt werden müssen. So werden Schwachstellen sichtbar, die bei einfachen Testfällen häufig unentdeckt bleiben.

Neben der Erfolgsquote sollten dabei weitere Kennzahlen betrachtet werden:

  • Anzahl der Tool-Aufrufe pro Aufgabe: Benötigt der Agent viele Aufrufe für ein Ergebnis, kann das darauf hindeuten, dass die Tools ungünstig zugeschnitten sind.
  • Fehlerquote und Art der Fehler: Treten beispielsweise häufig Fehler bei den benötigten Angaben auf, kann die Beschreibung oder Benennung der Parameter unklar sein.
  • Umfang der Rückgaben: Gibt ein Tool regelmäßig mehr Informationen zurück als benötigt, verbraucht es unnötig viel Kontext.
  • Laufzeit pro Aufruf: Lange Laufzeiten zeigen, welche Tools den gesamten Ablauf verlangsamen.

Die Auswertung zeigt häufig auch, dass für Verbesserungen keine grundlegenden technischen Änderungen notwendig sind. Schon Anpassungen an Namen, Beschreibungen oder Rückgabeformaten können dazu führen, dass ein Agent Tools zuverlässiger einsetzt.

Wie zuverlässig ein Agent arbeitet, hängt damit wesentlich von den Tools ab, die ihm zur Verfügung stehen. Gutes Tool Engineering beginnt bei den Aufgaben, die der Agent erledigen soll. Daraus werden passende Tools abgeleitet und so beschrieben, dass der Agent eindeutig erkennen kann, wann und wie er sie einsetzen muss.

Bei DataSpark sehen wir in Projekten regelmäßig, welchen Unterschied dieser Zuschnitt macht. Statt einem Agenten zahlreiche bestehende Schnittstellen einzeln zur Verfügung zu stellen, reichen häufig wenige, klar definierte Tools aus. Dadurch muss der Agent weniger Entscheidungen über einzelne technische Schritte treffen und kann Aufgaben zuverlässiger ausführen.

Sie möchten prüfen, ob die Tools Ihres KI-Agenten für den produktiven Einsatz richtig gestaltet sind? Sprechen Sie mit uns – wir unterstützen Sie dabei, bestehende Tools zu analysieren und gezielt weiterzuentwickeln.

Kontakt aufnehmen

Ausblick auf Teil 3 der Beitragsserie

Mit gutem Kontext und guten Werkzeugen ist ein Agent handlungsfähig. Offen bleibt, wie er seine Arbeit organisiert: Wann plant er, wann führt er aus, wann prüft er das eigene Ergebnis, und wann bricht er ab? Darum geht es im nächsten Teil, dem Loops Engineering, also der Gestaltung der Arbeitsschleifen eines Agenten. Wir schauen uns an, wie diese Schleifen aufgebaut sein sollten, damit ein Agent sich nicht im Kreis dreht, und woran sich erkennen lässt, dass eine Aufgabe besser in mehrere getrennte Durchläufe zerlegt wird.