A · Filesystem-native Agent
Starke Baseline mit Dateien, Suche, Shell/Tools und Freiheit, persistente Informationen selbst zu organisieren oder umzuschreiben.
research://memorybench
Ein architekturneutraler Benchmark für persistentes Agentengedächtnis: Kontinuität, zeitliche Korrektheit, Anpassung, Latenz und Kosten messen, ohne eine Speicherarchitektur konstruktiv zu bevorzugen.
research://thesis
MemoryBench vermeidet den schwachen Vergleich „Chat-Historie gegen Memory-Produkt“. Ein best-of-breed filesystem-native Agent darf Dateien durchsuchen, organisieren, umschreiben und konsolidieren. Diese starke Baseline wird mit SynapseFS sowie SynapseFS + SymbioRAP Memory unter gleichem Modell, Informationszugang und Compute-Budget verglichen.
focus://memorybench
Starke Baseline mit Dateien, Suche, Shell/Tools und Freiheit, persistente Informationen selbst zu organisieren oder umzuschreiben.
Gleiche Agentenbedingungen mit deterministischer Persistenz, stabilen Identitäten sowie Evidenz- und Versionssemantik.
Ergänzt episodisches/semantisches Gedächtnis, Temporal Graph, Konsolidierung und provenance-basierte Kontextauswahl.
Modell, Informationszugang, Tasks und Compute-Budget werden kontrolliert, damit Architektureffekte interpretierbar bleiben.
architecture://working-model
Das Protokoll soll Trade-offs sichtbar machen statt einen einzigen schmeichelhaften Score zu erzeugen. Gemessen wird, ob eine Architektur über lange Zeit korrekt bleibt, geänderte Fakten verarbeitet, passende Evidenz findet und dies mit praktikabler Latenz sowie Token-/Compute-Kosten erreicht.
Korrekte Aufgabenantworten und Evidenznutzung über kurze und lange Zeithorizonte.
Korrekte Behandlung abgelöster Fakten, geänderter Präferenzen und zeitabhängigen Zustands.
Fähigkeit, Verhalten zu revidieren, wenn neue Evidenz früheren Annahmen widerspricht.
Retrieval-/Konsolidierungsaufwand, Tokenverbrauch und Compute für stabile Gedächtnisqualität.
research://questions
Welche Tasks brauchen wirklich eine eigene Memory-Schicht statt disziplinierter Filesystem-Organisation?
Wie viel Verbesserung entsteht allein durch Persistenzsemantik, bevor semantisches Gedächtnis hinzukommt?
Welche Konsolidierungspolitiken verbessern Langzeitgenauigkeit, ohne stale oder überkonfidentes Gedächtnis zu erzeugen?
Wie müssen Benchmark-Tasks gestaltet sein, damit Modellmemorisation und architekturspezifische Shortcuts nicht dominieren?
status://research
Die dargestellten Punkte beschreiben Forschungs- und Implementierungsrichtungen. Sie sind keine Zusage fertiger Produktfunktionen.
connect://research
Für Forschungs-, Förder- und Technologiepartner teilen wir Architekturfragen, Benchmarkdesign und technische Arbeitsstände im qualifizierten Austausch.
Nächster sinnvoller Schritt
Sie müssen keine technische Lösung formulieren. Beschreiben Sie, was entstehen oder besser funktionieren soll. Wir ordnen Machbarkeit, sinnvollen ersten Umfang und nächste Schritte ein.
Idee kostenlos einschätzen lassen
Vier Felder reichen. Sie erhalten eine konkrete Rückmeldung dazu, wie sich Ihr Vorhaben sinnvoll klein starten und später erweitern lässt.