Multi-Agent-Desktop-Umgebung für interne Dev-Workflows
Desktop-App, die spezialisierte Agents (Planner, Researcher, Reviewer, Executor) in einer einzigen Oberfläche orchestriert. Task-Routing, Prompt-Caching-Layer, Terminal-Islands, Eval-Suite mit CI-Gate. Reduziert manuelle Tool-Switch-Zeit spürbar.
Kontext / Context
Ein Engineering-Team wollte mehrere spezialisierte Agents (Planning, Research, Review, Execution) aus einer einzigen Desktop-Oberfläche steuern, statt ständig zwischen CLI, Browser, Editor und Chat-Tools zu wechseln.
Architektur-Muster
- Shell: Desktop-Framework mit eingebetteten Terminal-Panes für direkte Shell-Kontrolle neben der Agent-UI
- UI: React-basiertes Layout mit persistentem Editor, Split-Panes, Session-Tabs
- Agent-Layer: Agent-SDK mit Tool-Use-Bridges in lokale Dateisystem-Operationen, Terminal-Commands und strukturierte Memory-Layer
- Prompt-Caching: aggressives Caching von System-Prompts und Tool-Definitionen, signifikante Token-Einsparung auf langen Sessions
- Persistence: lokale App-State-Datenbank für Session-History, Task-Queue, Agent-Präferenzen
- Observability: pro-Turn-Tracing mit Kosten- und Latenz-Metriken, zur Einspeisung in Eval-Harness
Eval + CI-Gate
- Regression-Testfälle in Kategorien wie Plan-Quality, Tool-Use-Correctness, Research-Depth, Review-Rigor
- Automatisches Gating im CI: überschreitet die Regression-Rate ein Threshold, blockt der Build
- Kosten-Budget pro Session-Klasse, Alert bei Überschreitung
Deliverable
Installierbare Desktop-App für macOS und Windows, vollständige Test-Suite, Runbook für das interne Support-Team, Playbook für das Hinzufügen neuer Agent-Typen oder Tool-Bridges.
Learnings
Multi-Agent-Orchestrierung gewinnt nicht durch “mehr Agents”, sondern durch zwei Dinge: (1) klare Task-Routing-Regeln mit explizitem Hand-off zwischen Spezialisten, und (2) ein Eval-Harness, das verhindert, dass eine Prompt- oder Model-Änderung stille Regressions in nur einer Agent-Rolle einführt. Ohne den Harness drifted das System innerhalb weniger Wochen.