Zum Inhalt springen
Manuel García-Llera Añón / Product Designer · Design EngineerKontakt

Fallstudie

Coordination Hub

Ein Arbeitsbereich, um die Arbeit mit mehreren KIs zu koordinieren und zu verstehen, was jede vorgeschlagen hat, was geprüft wurde und welche Entscheidung bei mir liegt.

Ich begann damit, ein Problem meiner eigenen Arbeit zu lösen: Beim Wechsel zwischen KIs verlor ich Kontext und musste Entscheidungen rekonstruieren. Der Hub, dessen experimentelle Oberfläche Testigo heißt, bündelt Projekte, Gespräche und überprüftes Wissen. Ich möchte die Arbeit verfolgen können, ohne einen Vorschlag mit einem verifizierten Ergebnis zu verwechseln.

Experimentell

Kontext
Eigenständiges Produkt · im Einsatz entwickelte Workflow-Infrastruktur
Beitrag
Produktausrichtung, Entscheidungsarchitektur und Definition von Verträgen für die Mensch-KI-Aufsicht
Technologien
Node.jsMCPJSONLZodClaudeOpenAI/Codex
Jahr
2026
Pilot
eigenständiges Produkt in Entwicklung
L0–L3
Autonomie mit menschlicher Entscheidungshoheit
MCP
Koordination zwischen getrennten Sitzungen

Zusammenarbeit: Ich habe mit Claude und Codex an Implementierung und Prüfung des Systems gearbeitet. Die Verantwortung für Produktausrichtung, Abnahmekriterien und genehmigungspflichtige Entscheidungen bleibt bei mir.

Eine reale Oberfläche mit Demonstrationsdaten. Diese Aufnahmen stammen aus der Entwicklung von Testigo und enthalten weder Arbeitsgespräche noch LALIGA-Informationen. Anbieter werden in dieser isolierten Sitzung als nicht verbunden angezeigt; die Ansichten zeigen das Design der Aufsicht, keinen laufenden autonomen Durchlauf.

Das Projekt, Schicht für Schicht

Kleine Entscheidungen bilden das System.

01 / 031. Einem Gespräch folgen

Ich ordne den Kontext nach Projekt und Gespräch. Jeder Beitrag behält seine Urheberschaft, und die Werkzeugverfügbarkeit lässt sich prüfen, ohne den Arbeitsbereich zu verlassen. Reale Oberfläche mit Demonstrationsdaten.

02 / 032. Gespeichertes überprüfen

Der Wissensspeicher unterscheidet empfangenes Material von überprüftem Wissen. Menschen sollen wiederverwendete Informationen einsehen und prüfen können, statt alles Geschriebene als gültig anzunehmen. Reale Oberfläche mit Demonstrationsdaten.

03 / 033. Ein weiteres Projekt einrichten

Ein eigener Arbeitsbereich macht die Grenze jedes Projekts deutlich. Das gehört zum Einstieg, den ich weiterhin teste, um den Einrichtungsaufwand zu senken und vermischte Kontexte zu vermeiden. Reale Oberfläche mit Demonstrationsdaten.

Recherche

Das Problem entstand während der Arbeit. Ich kopierte Antworten zwischen Assistenten, wiederholte Kontext und investierte Zeit in die Prüfung dessen, was tatsächlich erledigt worden war. Ich wollte drei oft vermischte Dinge trennen: Auftrag, Vorschlag und Ergebnisnachweis.

Ich definierte Autonomiestufen, damit eine Empfehlung nicht von selbst zur Genehmigung werden kann. L0 erlaubt Beobachtung; L1 und L2 begrenzen Aktionen nach ihrem Umfang; L3 behält die folgenreichsten Entscheidungen einem Menschen vor.

Methoden:Bewertung des tatsächlichen Aufwands menschlicher Vermittlung · Vergleich vorhandener Frameworks und Entscheidung für eine maßgeschneiderte Lösung · Autonomiemodell L0–L3, mit L3 für einen Menschen reserviert · Messbare Erfolgskriterien vor dem ersten Code.

Prototyp

Ich ordnete die Oberfläche um eine konkrete Aufgabe: verstehen, was meine Aufmerksamkeit braucht. Kontext steht links, das Gespräch in der Mitte und der Werkzeugstatus rechts. Der Wissensspeicher wird bei Bedarf konsultiert, statt dauerhaft Lesefläche zu belegen.

Das Ereignisprotokoll erhält die operative Spur. Darauf aufbauende Ansichten ermöglichen es, ein Gespräch zu lesen und seine Entscheidungen zu prüfen, ohne das gesamte technische Protokoll durchzugehen.

KI im Prozess

In diesem Projekt nutze ich KI, um ein Werkzeug zu bauen, das mir auch bei ihrer Aufsicht helfen soll. Ich wechsle mit Claude und Codex zwischen Implementierung und Prüfung und gleiche ihre Schlussfolgerungen mit Code und Tests ab. Zwei übereinstimmende Antworten reichen mir nicht als Validierung.

Werkzeug
Claude · Codex, über den Hub selbst miteinander koordiniert
Phase
Der gesamte Zyklus: Spezifikation, Implementierung, gegenseitige Prüfung und Verifikation
Menschlicher Beitrag
Problem, Abnahmekriterien, Entscheidungsarchitektur, Prioritäten und jede unumkehrbare Freigabe
KI-Ergebnis
Implementierung, Tests und unabhängige Prüfungen mit priorisierten Befunden und Nachweisen
Auswahlkriterien
Überprüfbare Nachweise, Umkehrbarkeit, Projektisolation, keine Geheimnisse und bestandene Tests
Erkannte Grenzen
Keine KI erweitert ihre eigenen Berechtigungen, entscheidet Unumkehrbares oder erklärt Konsens ohne unabhängige Prüfung
Endgültige Entscheidung
Menschliche Entscheidungshoheit über alles Unumkehrbare. KIs entscheiden über umkehrbare Aktionen und hinterlassen eine Spur

Entwicklung

Der Hub stellt über MCP Operationen bereit, um Nachrichten zu lesen, Antworten zu protokollieren und Nachweise aus kompatiblen Werkzeugen beizutragen. Der Vertrag unterscheidet Senden, Empfangen, Verarbeiten und Verifizieren: Das sind verschiedene Zustände, und so soll sie auch die Oberfläche behandeln.

Ich konzentrierte mich auf Wiederherstellung, Wiederholungsversuche und Projekttrennung. Das sind unspektakuläre Situationen, aber unverzichtbar, damit ein Koordinationswerkzeug nicht mehr Unsicherheit erzeugt, als es beseitigt.

Validierung

Eine Prüfung deckte ein aufschlussreiches Problem auf: Ein Thema konnte als Konsens abgeschlossen werden, ohne eine unabhängige Prüfung zu kontrollieren. Wir korrigierten den Vertrag, um diese Prüfung zu verlangen und Nachweise zu bewahren. Dieser Befund veränderte mein Designurteil: Ein positiver Status muss seine Grundlage erklären.

Die erste Version dokumentierte 95 automatisierte Tests. Das ist ein historischer Entwicklungsnachweis, keine Garantie, dass das heutige Produkt fertig ist. Der Hub bleibt ein Pilot; seine Benutzerfreundlichkeit muss weiterhin mit Menschen geprüft werden. Eine Bildschirmaufnahme oder ein Codetest ersetzt diese Validierung nicht.

Vom Prototyp zur Komponente

Aufbau des Systems

  • Grundlagen / Autonomiestufen · Verfügbarkeitszustände · Sichtbarkeitsklassen
  • Organismen / Aufmerksamkeitswarteschlange · Gesprächsverlauf · Konsensbereich
  • Organismen / Entscheidungsprotokoll · Agentenverzeichnis · Nachweiskette

Code · Implementierungsnachweis

const requiredReviewers = [
  ...new Set(target.to.filter((agent) => agent !== parsed.from)),
]
if (requiredReviewers.length === 0) {
  throw new Error('Consensus requires an independent review')
}

const reviewedBy = requiredReviewers.filter((reviewer) =>
  events.some(
    (event) =>
      event.correlationId === target.id &&
      event.from === reviewer &&
      ['review', 'objection', 'result'].includes(event.messageKind),
  ),
)
if (reviewedBy.length !== requiredReviewers.length) {
  throw new Error('Consensus requires an independent review from: ...')
}

const level =
  parsed.reversibility === 'irreversible' ? 'L3' : topicLevel
if (level === 'L3' && parsed.from !== 'manuel') {
  throw new Error('L3 consensus may only be resolved by Manuel')
}

src/store.mjs · resolveTopic()

Der Kern des Systems: die Konsensschranke. Früher genügte die Erklärung eines Agenten; heute sind unabhängige Prüfungen aller erforderlichen Prüfer nötig, und die Stufe wird abgeleitet statt zugewiesen.

consensusState = 'reviewed' | 'provisional' | 'lapsed' ← aus protokollierten Prüfungen abgeleitet, nicht vom abschließenden Agenten erklärt

Erkenntnisse

Intelligenz von Entscheidungshoheit trennen: Wenn eine Seite vorschlägt und ein anderer, deterministischer Teil autorisiert, wird eine Empfehlung nicht mit einer Entscheidung verwechselt.

Eine Einigung ohne unabhängige Prüfung ist kein Konsens, sondern eine Meinung mit Gütesiegel. Wenn das System dies nicht kontrolliert, wird es irgendwann passieren.

Nichtverfügbarkeit durch Kontingentgrenzen ist kein Sonderfall, sondern ein normaler Zustand: Das Design sollte seine Funktion ausdrücklich reduzieren, statt stecken zu bleiben.

Ich habe gelernt, Entscheidungen während der Arbeit zu dokumentieren: Den Kontext später zu rekonstruieren kostet mehr Mühe und kann Lücken hinterlassen.

Offene Frage:Was muss ein Mensch sehen, um mehrere autonome Agenten sicher zu beaufsichtigen, ohne alles zu lesen, was sie erzeugen?

Kontakt

Lass uns sprechen.

Wenn du denkst, dass meine Arbeitsweise zu deinem Team passt, oder ein Produkt beziehungsweise ein Forschungsprojekt entwickeln möchtest, würde ich gern mehr erfahren. Erzähle mir, was du brauchst und wo du gerade stehst. Ich lese deine Nachricht persönlich.

Du findest mich auch auf LinkedIn

Deine Adresse wird ausschließlich verwendet, um auf diese Nachricht zu antworten.