Baike.dev
Anmelden
> 返回资讯列表
news_article.exe
📰
#Claude

Die State-Achse: Warum Agenten-Benchmarks weiterhin Amnesien-Modelle messen

The state axis: why agent benchmarks keep measuring amnesiac models

2026年9月9日6 次浏览来源:Dev.to 阅读原文

Ich hämmere immer wieder den Punkt, dass jeder Coding-Agent-Score Modell + Gurtzeug ist, nicht Modell allein. Gleiche Kontext-Übertragungsregeln, gleiche Notizkonvention, gleiche Werkzeugschleife, gleicher Richter oder der Vergleich ist Müll. Engrim (github.com/timgordontg/engrim) ist eine nützliche Erinnerung daran, dass es eine dritte Achse gibt, die ich unterbiete: Staat. Es ist eine lokale erste SQLite-Speicher-Engine für Claude Code, Cursor, Windsurf, Codex. Projekt-scoped, bettet Datensätze plus SQLite FTS ein, besteht aus Entscheidungen und Gründen zwischen den Sitzungen. Hybrid Retrieval, keine Cloud. Cross-session recall ist der gesamte pitch. Und hier ist die Sache: Dieser Pitch funktioniert nur, wenn der Agent tatsächlich besser wird, wenn sein Gedächtnis wächst. Engrim existiert, weil die Autoren glauben, dass der persistente Projektkontext bei jeder neuen Sitzung ein kaltes Kontextfenster schlägt. Was ist...

Ich hämmere immer wieder den Punkt, dass jeder Coding-Agent-Score Modell + Gurtzeug ist, nicht Modell allein. Gleiche Kontext-Übertragungsregeln, gleiche Notizkonvention, gleiche Werkzeugschleife, gleicher Richter oder der Vergleich ist Müll. Engrim (github.com/timgordontg/engrim) ist eine nützliche Erinnerung daran, dass es eine dritte Achse gibt, die ich unterbiete: Staat. Es ist eine lokale erste SQLite-Speicher-Engine für Claude Code, Cursor, Windsurf, Codex. Projekt-scoped, bettet Datensätze plus SQLite FTS ein, besteht aus Entscheidungen und Gründen zwischen den Sitzungen. Hybrid Retrieval, keine Cloud. Cross-session recall ist der gesamte pitch. Und hier ist die Sache: Dieser Pitch funktioniert nur, wenn der Agent tatsächlich besser wird, wenn sein Gedächtnis wächst. Engrim existiert, weil die Autoren glauben, dass der persistente Projektkontext bei jeder neuen Sitzung ein kaltes Kontextfenster schlägt. Das ist genau das, was fast keine Benchmark-Maßnahmen. Schauen sie sich an, wie agent evals tatsächlich gebaut werden. Sie laden ein Repo, lassen Sie bei einem Problem fallen und erhalten den Patch. Leer CLAUDE.md. Keine Cursorregeln. Keine Speicherdatei. Jeder Lauf startet das Modell bei der gleichen Amnesie. Das ist bewusst, für die Reproduzierbarkeit. Sie können keine Partitur ausführen, wenn der Kopf des Modells voller Geheimnisse des letzten Laufs ist. Aber saubere Reproduzierbarkeit kaufte eine verzerrte Messung. Der Agent, den Sie kalt bewerten, ist nicht der Agent, den Ihr Team nach einem Monat akkumuliertem Projektspeicher betreibt. Je mehr ein Agent zwischen den Sitzungen hält, desto breiter wird diese Lücke. Ein 30-minütiges Kaltstart-Eval sagt Ihnen fast nichts darüber aus, wie ein Agent mit sechs Monaten verschluckter Projektentscheidungen mit einer echten Migration umgehen wird. Dies ist die gleiche strukturelle Blindheit wie korrelierte Richter, die eine Sitzung erzielt haben: Sie haben einen blinden Fleck gemessen und ihn ein Komitee genannt. Hier haben Sie einen Speicherzustand (leer) gemessen und ihn das Modell genannt. Die Variable, die die Produktionsleistung tatsächlich antreibt, ist genau die Variable, die die Eval-Pins auf Null bringen. Der Fix muss die Reproduzierbarkeit nicht zerstören. Sie können es stattdessen parametrieren: Führen Sie eine Aufgabe drei Wege aus, leeren Kontext, einen kleinen handkuratierten Projektspeicher und einen großen. Beobachten Sie den Score Move. Sagen Sie mir, welches Tool sich am meisten bewegt hat, und ich sage Ihnen, welches Sie in einem langlebigen Repo ausführen sollten. Dieses Ergebnis ist nützlicher als hundert saubere Kaltstarttische. Engrim ist hier nicht das Produkt. Es ist der Tell, dass diese Achse wichtig ist und niemand Benchmarking es. Wenn ihr eval amnesiac-modelle misst, sind seine punkte ein boden, und die lücke zur produktion ist ihr wahres signal.

> 分享:
Baike.dev

baike.dev hilft dir, starke Sprachen, Frameworks, Datenbanken, DevOps- und Cloud-Native-Tools zu entdecken.

Schnellzugriff

Über uns

Mitmachen

Kennst du ein starkes Entwickler-Tool? Teile es.

Tool einreichen
© 2026 baike.dev Entwickler-EnzyklopädieTäglich aktualisiert · Entdecke starke Entwickler-Tools