#973·ds4

在使用 ds4-agent 时过早进行压缩

作者: arthurnowak创建于 2026年9月4日更新于 2026年9月17日

运行在 MacStudio Ultra M1 128GB 上 sudo sysctl iogpu.wired_limit_mb=112640 cd Git/ds4/ds4-main/ Git/ds4/ds4-main/ds4-agent -m Git/ds4/gguf/DeepSeek-V4-Flash-IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8-chat-v2-imatrix-0731.gguf --mtp-model Git/ds4/gguf/DeepSeek-V4-Flash-0731-DS4-Quality128-DSpark-support.gguf --metal -c 32768 iogpu.wired_limit_mb: 112640 -> 112640 ds4: DSpark 支持模型检测到: Git/ds4/gguf/DeepSeek-V4-Flash-0731-DS4-Quality128-DSpark-support.gguf (stages=3 block=5 markov_rank=256 tensors=81 missing=0 invalid=0 metadata_errors=0); 使用 --dspark 可启用实验性运行解码 ds4: Metal 设备 Apple M1 Ultra, 128.00 GiB RAM ds4: Metal 4 tensor API 为预 M5/预 A19 设备禁用 ds4: drift-patch 标志 hc_stable=on norm_unify=on kv_raw_f32=off rope_exp2_log2=off math_safe=off tensor_matmul=off ds4: 请求 Metal 居留 (可能需要数十秒) ... 完成 ds4: 正在暖通 Metal 模型视图 ... 完成 ds4: 创建 Metal 模型视图花费 3.118 ms, 请求居留花费 667.125 ms, 温暖 4.001 ms (从偏移 5.09 MiB 获取 82697.67 MiB 的映射) ds4: Metal 将 mmaped 模型映射为 2 个重叠的共享缓冲区 ds4: 为图形诊断初始化 metal 后端 ds4: 内存: KV 0.61 GiB (原始 0.36 + 压缩 0.25) + 缓冲区 0.25 GiB + 居留模型 80.76 GiB = 81.62 GiB 计划 ds4: 内存详细信息: ctx=32768 prefill_cap=4096 raw_kv_rows=4352 compressed_kv_rows=8194 backend=metal DwarfStar Agent, context 32.8k tokens * 你能读取 check_indexes.py 让我读取 check_indexes.py 文件。 ️ 正在读取 check_indexes.py 1:500... COMPACTING 工具结果将超过上下文: 总结持久性任务状态 内部 ds4-agent 上下文压缩请求。这不是用户请求。 编写对话到目前为止的持久性任务状态摘要。仅保留重要的事实继续工作: - 用户目标、约束和偏好 - 已检查或编辑的文件 - 运行的命令和重要结果 - 决策、拒绝的方法、已知错误和待办的下一步 - 可重载的大型数据,如果可用则保留精确的路径/范围/命令 不要发明事实。不要包含一般性的叙述。不要包含原始文件内容,除非它们对结论至关重要。 完成摘要后,停止。不要继续用户任务,不要调用工具,也不要输出思考标签或 DSML 标记。只输出紧凑的摘要 压缩原因: 工具结果将超过上下文 COMPACTING 重建上下文: old=1804 summary+tail=1960 tail=67 ds4-agent: 上下文经过压缩后已满 状态显示 ctx 1.9k/32.8k | idle 即使我指定了 32.8k 个令牌的上下文,但似乎上下文被限制在 1960 个令牌