A · Agente filesystem-native
Baseline forte con file, ricerca, shell/tools e libertà di organizzare o riscrivere informazioni persistenti.
research://memorybench
An architecture-neutral benchmark for persistent agent memory: measure continuity, temporal correctness, adaptation, latency and cost without rewarding one storage design by construction.
research://thesis
MemoryBench avoids a weak “chat history vs memory product” comparison. The benchmark gives a best-of-breed filesystem-native agent real tools to search, organize, rewrite and consolidate its own persistent workspace, then compares that baseline with SynapseFS and SynapseFS + SymbioRAP Memory under matched model, information and compute conditions.
focus://memorybench
Baseline forte con file, ricerca, shell/tools e libertà di organizzare o riscrivere informazioni persistenti.
Stesse condizioni con persistenza deterministica, identità stabili e semantica evidence/versioni.
Aggiunge memoria episodica/semantica, temporal graph, consolidamento e context selection con provenance.
Modello, accesso alle informazioni, task e compute budget sono controllati per rendere interpretabile l’effetto architetturale.
architecture://working-model
Il protocollo mira a mostrare trade-off, non a produrre un unico score favorevole. Misura se un’architettura resta corretta nel tempo, si adatta a fatti cambiati, recupera l’evidence giusta e lo fa con latency e budget token/compute pratici.
Risposte corrette e uso dell’evidence su orizzonti brevi e lunghi.
Gestione corretta di fatti sostituiti, preferenze cambiate e stato dipendente dal tempo.
Capacità di rivedere il comportamento quando nuova evidence contraddice ipotesi precedenti.
Overhead di retrieval/consolidation, token e compute necessari a mantenere la qualità della memoria.
research://questions
Quali task richiedono davvero un livello Memory dedicato invece di una buona organizzazione filesystem?
Quanto miglioramento deriva dalla sola semantica di persistenza prima di aggiungere memoria semantica?
Quali policy di consolidamento migliorano l’accuracy long-horizon senza creare memoria stale o troppo sicura?
Come rendere i task di benchmark resistenti a memorization del modello e shortcut specifici dell’architettura?
status://research
I punti descritti sono direzioni di ricerca e implementazione, non promesse di funzionalità prodotto finite.
connect://research
Con partner di ricerca, finanziamento e tecnologia condividiamo questioni architetturali, design dei benchmark e stati tecnici in un confronto qualificato.
Prossimo passo utile
Non devi definire la soluzione tecnica. Descrivi cosa vuoi creare o migliorare e valuteremo fattibilità, primo ambito e passi successivi.
Valuta gratuitamente l’idea
Quattro campi bastano. Riceverai una risposta concreta su come partire in piccolo e ampliare poi il progetto.