Fallstudie
Coordination Hub
Ein Arbeitsbereich, um die Arbeit mit mehreren KIs zu koordinieren und zu verstehen, was jede vorgeschlagen hat, was geprüft wurde und welche Entscheidung bei mir liegt.
Ich begann damit, ein Problem meiner eigenen Arbeit zu lösen: Beim Wechsel zwischen KIs verlor ich Kontext und musste Entscheidungen rekonstruieren. Der Hub, dessen experimentelle Oberfläche Testigo heißt, bündelt Projekte, Gespräche und überprüftes Wissen. Ich möchte die Arbeit verfolgen können, ohne einen Vorschlag mit einem verifizierten Ergebnis zu verwechseln.
Experimentell
- Pilot
- eigenständiges Produkt in Entwicklung
- L0–L3
- Autonomie mit menschlicher Entscheidungshoheit
- MCP
- Koordination zwischen getrennten Sitzungen
Zusammenarbeit: Ich habe mit Claude und Codex an Implementierung und Prüfung des Systems gearbeitet. Die Verantwortung für Produktausrichtung, Abnahmekriterien und genehmigungspflichtige Entscheidungen bleibt bei mir.
Eine reale Oberfläche mit Demonstrationsdaten. Diese Aufnahmen stammen aus der Entwicklung von Testigo und enthalten weder Arbeitsgespräche noch LALIGA-Informationen. Anbieter werden in dieser isolierten Sitzung als nicht verbunden angezeigt; die Ansichten zeigen das Design der Aufsicht, keinen laufenden autonomen Durchlauf.
Das Projekt, Schicht für Schicht
Kleine Entscheidungen bilden das System.
Ich ordne den Kontext nach Projekt und Gespräch. Jeder Beitrag behält seine Urheberschaft, und die Werkzeugverfügbarkeit lässt sich prüfen, ohne den Arbeitsbereich zu verlassen. Reale Oberfläche mit Demonstrationsdaten.
Der Wissensspeicher unterscheidet empfangenes Material von überprüftem Wissen. Menschen sollen wiederverwendete Informationen einsehen und prüfen können, statt alles Geschriebene als gültig anzunehmen. Reale Oberfläche mit Demonstrationsdaten.
Ein eigener Arbeitsbereich macht die Grenze jedes Projekts deutlich. Das gehört zum Einstieg, den ich weiterhin teste, um den Einrichtungsaufwand zu senken und vermischte Kontexte zu vermeiden. Reale Oberfläche mit Demonstrationsdaten.
Recherche
Das Problem entstand während der Arbeit. Ich kopierte Antworten zwischen Assistenten, wiederholte Kontext und investierte Zeit in die Prüfung dessen, was tatsächlich erledigt worden war. Ich wollte drei oft vermischte Dinge trennen: Auftrag, Vorschlag und Ergebnisnachweis.
Ich definierte Autonomiestufen, damit eine Empfehlung nicht von selbst zur Genehmigung werden kann. L0 erlaubt Beobachtung; L1 und L2 begrenzen Aktionen nach ihrem Umfang; L3 behält die folgenreichsten Entscheidungen einem Menschen vor.
Methoden:Bewertung des tatsächlichen Aufwands menschlicher Vermittlung · Vergleich vorhandener Frameworks und Entscheidung für eine maßgeschneiderte Lösung · Autonomiemodell L0–L3, mit L3 für einen Menschen reserviert · Messbare Erfolgskriterien vor dem ersten Code.
Prototyp
Ich ordnete die Oberfläche um eine konkrete Aufgabe: verstehen, was meine Aufmerksamkeit braucht. Kontext steht links, das Gespräch in der Mitte und der Werkzeugstatus rechts. Der Wissensspeicher wird bei Bedarf konsultiert, statt dauerhaft Lesefläche zu belegen.
Das Ereignisprotokoll erhält die operative Spur. Darauf aufbauende Ansichten ermöglichen es, ein Gespräch zu lesen und seine Entscheidungen zu prüfen, ohne das gesamte technische Protokoll durchzugehen.
KI im Prozess
In diesem Projekt nutze ich KI, um ein Werkzeug zu bauen, das mir auch bei ihrer Aufsicht helfen soll. Ich wechsle mit Claude und Codex zwischen Implementierung und Prüfung und gleiche ihre Schlussfolgerungen mit Code und Tests ab. Zwei übereinstimmende Antworten reichen mir nicht als Validierung.
- Werkzeug
- Claude · Codex, über den Hub selbst miteinander koordiniert
- Phase
- Der gesamte Zyklus: Spezifikation, Implementierung, gegenseitige Prüfung und Verifikation
- Menschlicher Beitrag
- Problem, Abnahmekriterien, Entscheidungsarchitektur, Prioritäten und jede unumkehrbare Freigabe
- KI-Ergebnis
- Implementierung, Tests und unabhängige Prüfungen mit priorisierten Befunden und Nachweisen
- Auswahlkriterien
- Überprüfbare Nachweise, Umkehrbarkeit, Projektisolation, keine Geheimnisse und bestandene Tests
- Erkannte Grenzen
- Keine KI erweitert ihre eigenen Berechtigungen, entscheidet Unumkehrbares oder erklärt Konsens ohne unabhängige Prüfung
- Endgültige Entscheidung
- Menschliche Entscheidungshoheit über alles Unumkehrbare. KIs entscheiden über umkehrbare Aktionen und hinterlassen eine Spur
Entwicklung
Der Hub stellt über MCP Operationen bereit, um Nachrichten zu lesen, Antworten zu protokollieren und Nachweise aus kompatiblen Werkzeugen beizutragen. Der Vertrag unterscheidet Senden, Empfangen, Verarbeiten und Verifizieren: Das sind verschiedene Zustände, und so soll sie auch die Oberfläche behandeln.
Ich konzentrierte mich auf Wiederherstellung, Wiederholungsversuche und Projekttrennung. Das sind unspektakuläre Situationen, aber unverzichtbar, damit ein Koordinationswerkzeug nicht mehr Unsicherheit erzeugt, als es beseitigt.
Validierung
Eine Prüfung deckte ein aufschlussreiches Problem auf: Ein Thema konnte als Konsens abgeschlossen werden, ohne eine unabhängige Prüfung zu kontrollieren. Wir korrigierten den Vertrag, um diese Prüfung zu verlangen und Nachweise zu bewahren. Dieser Befund veränderte mein Designurteil: Ein positiver Status muss seine Grundlage erklären.
Die erste Version dokumentierte 95 automatisierte Tests. Das ist ein historischer Entwicklungsnachweis, keine Garantie, dass das heutige Produkt fertig ist. Der Hub bleibt ein Pilot; seine Benutzerfreundlichkeit muss weiterhin mit Menschen geprüft werden. Eine Bildschirmaufnahme oder ein Codetest ersetzt diese Validierung nicht.
Vom Prototyp zur Komponente
Aufbau des Systems
- Grundlagen / Autonomiestufen · Verfügbarkeitszustände · Sichtbarkeitsklassen
- Organismen / Aufmerksamkeitswarteschlange · Gesprächsverlauf · Konsensbereich
- Organismen / Entscheidungsprotokoll · Agentenverzeichnis · Nachweiskette
Code · Implementierungsnachweis
const requiredReviewers = [
...new Set(target.to.filter((agent) => agent !== parsed.from)),
]
if (requiredReviewers.length === 0) {
throw new Error('Consensus requires an independent review')
}
const reviewedBy = requiredReviewers.filter((reviewer) =>
events.some(
(event) =>
event.correlationId === target.id &&
event.from === reviewer &&
['review', 'objection', 'result'].includes(event.messageKind),
),
)
if (reviewedBy.length !== requiredReviewers.length) {
throw new Error('Consensus requires an independent review from: ...')
}
const level =
parsed.reversibility === 'irreversible' ? 'L3' : topicLevel
if (level === 'L3' && parsed.from !== 'manuel') {
throw new Error('L3 consensus may only be resolved by Manuel')
}src/store.mjs · resolveTopic()
Der Kern des Systems: die Konsensschranke. Früher genügte die Erklärung eines Agenten; heute sind unabhängige Prüfungen aller erforderlichen Prüfer nötig, und die Stufe wird abgeleitet statt zugewiesen.
consensusState = 'reviewed' | 'provisional' | 'lapsed' ← aus protokollierten Prüfungen abgeleitet, nicht vom abschließenden Agenten erklärt
Erkenntnisse
Intelligenz von Entscheidungshoheit trennen: Wenn eine Seite vorschlägt und ein anderer, deterministischer Teil autorisiert, wird eine Empfehlung nicht mit einer Entscheidung verwechselt.
Eine Einigung ohne unabhängige Prüfung ist kein Konsens, sondern eine Meinung mit Gütesiegel. Wenn das System dies nicht kontrolliert, wird es irgendwann passieren.
Nichtverfügbarkeit durch Kontingentgrenzen ist kein Sonderfall, sondern ein normaler Zustand: Das Design sollte seine Funktion ausdrücklich reduzieren, statt stecken zu bleiben.
Ich habe gelernt, Entscheidungen während der Arbeit zu dokumentieren: Den Kontext später zu rekonstruieren kostet mehr Mühe und kann Lücken hinterlassen.
Offene Frage:Was muss ein Mensch sehen, um mehrere autonome Agenten sicher zu beaufsichtigen, ohne alles zu lesen, was sie erzeugen?
Kontakt
Lass uns sprechen.
Wenn du denkst, dass meine Arbeitsweise zu deinem Team passt, oder ein Produkt beziehungsweise ein Forschungsprojekt entwickeln möchtest, würde ich gern mehr erfahren. Erzähle mir, was du brauchst und wo du gerade stehst. Ich lese deine Nachricht persönlich.
Du findest mich auch auf LinkedIn