Activity Frames:用确定性管线把屏幕活动压成 Agent 记忆

8 月 6 日(北京时间)傍晚,arXiv 上挂出一篇相当反潮流的论文:**Activity Frames: ...

8 月 6 日(北京时间)傍晚,arXiv 上挂出一篇相当反潮流的论文:Activity Frames: Compiling Deterministic Pipelines for Agent Memory from Screen Activity,作者是独立研究者 Nossa Iyamu。同一篇也登上了 HuggingFace Daily Papers 的社区热门。

论文要解决的具体问题是:现在大伙给 Agent 做长期 context 的主流办法是「拿 LLM 写摘要」——今天屏幕发生了什么、用户做了哪些事,丢给 LLM 总结成一段文字塞进 prompt。这个方法有两个明显的毛病:摘要不可缓存(同一天同一个窗口重跑一次文字可能不一样)、不可审计(用户想知道 Agent 到底看到了什么,只能重放原始日志)、不可重现。

Iyamu 的应对是把整个管线变成零模型 + 确定性——屏幕上每发生一次切换(窗口焦点变化、URL 跳转、滚动事件),都被一组规则打成「事件帧」。再通过三个常量参数(dwell 90s / session gap 300s / flicker merge 20s)合并成「活动帧(Activity Frame)」。最后用一个 R 树索引结构把 24 小时内的所有帧存成一段字节一致的二进制块。

数字很值得展开:

86× 压缩:在作者自己 51 个活跃天的语料(128,756 帧)上,把一整天的原始捕获压成 86 倍小的 prompt 块。论文自己承认这个压缩比主要来自「去掉重复像素 + 把时间窗口合并」两件事,跟 LLM 摘要比意义不大——LLM 摘要本来也不存原始像素。 – 68 毫秒编译:把一天的 128,756 帧跑完整个管线用 68ms。这是「确定性 + 零模型」最直接的好处——可以热缓存、可以离线重算、可以放进 CI。 – 98.4% 问答准确率:这个数字需要小心看。实验设置是作者自己设计的 QA 任务(基于 51 天屏幕日志出 100 道题),Agent 拿到「压缩后的活动帧」和「原始日志」分别回答,对照标准答案的 accuracy。基线是 LLM 摘要(用 GPT-4o 生成当天的活动总结),数字是 66-80%。换句话说,在作者自己构造的 QA 数据集上,确定性压缩完胜 LLM 摘要。但这个结论的边界很窄。

跟 OpenAI 的 Operator、Anthropic 的 Computer Use、苹果的 ScreenKit 这些「用 LLM 看屏幕」的路线不一样,Activity Frames 的逻辑是根本不让 LLM 看屏幕——LLM 只读最后编译出来的活动帧。好处是 LLM 那部分成本和延迟几乎为零,坏处是这套管线对「屏幕上发生了什么」的建模是 hand-crafted 的,作者承认它对视频帧、音频、跨窗口拖拽这些场景覆盖有限。

值得说的一点是论文里给了一个「可缓存性」的形式化证明——只要当天事件序列不变,活动帧的字节输出就字节一致(byte-identical)。这听起来像废话,但对 LLM 摘要来说这件事不成立。把它做成可缓存,意味着同一份活动帧可以给多个 Agent 共用、可以持久化、可以做差分更新。

作者同步开源了实现:activity-frames 在 GitHub(https://github.com/nossa-iyamu/activity-frames ),Python 包同名,已发 PyPI(0.1.0 版,2026-08-06 上线)。代码、CLI、compile.py 都齐,作者在自述文章里也披露了「55 天自用 vs 论文写 51 天」的差异并解释了原因(最后几天整理期未纳入统计窗口)。

来源: – arXiv abs:https://arxiv.org/abs/2608.05784 – arXiv HTML 全文:https://arxiv.org/html/2608.05784 – GitHub 仓库(实现 + 数据样例):https://github.com/nossa-iyamu/activity-frames – PyPI 包:https://pypi.org/project/activity-frames/ – 作者自述文章(passions.com):https://www.passions.com/@nossa/55-days-of-screen-memory – HuggingFace Daily Papers 社区热门:https://huggingface.co/papers/2608.05784

判断:这是给 Agent 长期 context 工程「去 AI 化」的一个样本。论文的核心论点不是「LLM 摘要不够好」,而是「某些任务根本不需要 LLM 介入」——把屏幕活动编译成 Agent 记忆这件事完全可以由确定性管线完成,省下来的 LLM 调用成本和延迟可观。但作者自己承认,QA 任务范围窄、n=1 个体、可推广性受限。

限制: – 评测数据集由作者自己构造,100 道题覆盖的应用场景有限 – 没与当前 SOTA 的 RAG / 长 context 方案做对比(如 MemGPT、Letta、Anthropic Context Retrieval) – 仅单人单设备;多设备同步、跨设备 dedup 没讨论 – 三个常量(dwell / session gap / flicker merge)硬编码,跨人/跨应用的可推广性未知 – 屏幕内容的语义理解(屏幕说了什么、做了什么决策)仍需 LLM;Activity Frames 只解决了「活动流」一维,缺「内容流」 – 隐私:本地化是默认选项,但论文未讨论端云协同场景下的边界 – 与 Apple Intelligence 的「screen-aware」隐私机制、OpenAI Operator 的安全边界没做横向对比

如果这条路线被验证下来,对 Agent 框架层的影响是:长期记忆从「vector store + LLM summarization」二元结构,可能演化成「deterministic frame + selective LLM enrichment」三元结构。MemGPT 这类项目的位置会变得微妙。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1