摘要
AI 应用不是一个聊天窗口,而是一套可留下行动痕迹的本地工作系统
当 AI 从“问答工具”进入任务编排、代码处理、文档生成、浏览器操作和外部连接的工作流,电子数据审查面对的对象也随之改变。我们不应再只问“这个软件是否安装过”,而应进一步审查:它保存了哪些任务、文件、工具、配置、时间和结果;这些信息能否被固定、关联和复核;又如何避免把“具备能力”误认成“已经实施”。
CFLAB 云迹围绕 Alpha-Claw、WorkBuddy、Hermes、Claude、MiniMax Agent CN 与 Codex 六类本地 AI Agent 样本开展元数据级研究,提出以“交互层 + 控制层”为核心的 AI 应用痕迹模型,并将发现、时间、来源、哈希和状态链组织为 MyHex 可消费的插件化审查能力。研究的目标,是让复杂的 AI 应用本地痕迹从难以阅读的目录和数据库,变成专业人员能够核对、解释和追溯的技术事实。
关键词:AI Agent;电子数据取证;本地痕迹;时间线;来源链;MyHex;技术审查
01
为什么 AI Agent 正在成为新的电子数据现场
传统软件取证往往围绕安装、登录、文件和网络活动展开。但 AI Agent 的本地运行方式更接近一个持续工作的数字助理:它可能维护会话与项目,保存任务队列和检查点,读取工作区文件,调用插件或连接器,生成文档、图像、脚本与下载物,并在浏览器或 WebView 中留下辅助状态。
这使得一个 AI 应用现场至少包含三类值得审查的问题。第一,过程问题:任务何时建立、推进、暂停、重试或交付。第二,来源问题:文件、附件和输出如何进入或离开工作区。第三,能力问题:应用配置了什么工具、连接器、浏览器或自动化能力,以及这些能力处于什么状态。
目录、插件、配置或数据库的存在,只能证明某种痕迹面存在;它们不能单独证明某项操作已经发生。AI 应用取证必须把“能力存在”与“行为发生”分开。
02
六类样本带来的共同发现
六类样本覆盖桌面工作台、长期运行 Agent、会话型客户端、项目型助手和开发型 Agent。它们的目录结构不同,但研究表明,真正可复用的不是某个固定路径,而是一套跨应用都可能出现的痕迹关系。
| 样本 | 研究重点 | 常见本地保存面 | 技术审查价值 |
|---|---|---|---|
| Alpha-Claw | 运行时、技能扩展、工作区与浏览器态 | ~/.openclaw-alphaclaw/ |
识别对话、任务、扩展与工作区是否可建立来源关系 |
| WorkBuddy | 桌面工作台、双根目录、自动化与连接器 | ~/.workbuddy/ + ~/WorkBuddy/ |
区分应用状态、可见工作区与外部调用边界 |
| Hermes | 任务编排、运行记录、检查点与策略 | ~/.hermes/ |
把长期 Agent 的任务、状态、运行与配置拆开审查 |
| Claude | 会话、项目、下载、文件历史与交接 | ~/.claude/ |
构建文件进入、引用、生成、下载和导出的生命周期 |
| MiniMax Agent CN | 轻量项目型持久化 | ~/.minimax-agent-cn/projects/ |
作为低状态密度 Agent 的对照,避免只按数据库判断 |
| Codex | 线程、目标、子任务、记忆、技能与多模态产物 | ~/.codex/ |
将任务谱系、控制面和工作区绑定纳入同一审查框架 |
表中为研究关注的常见保存面,具体目录和字段会随系统、版本和安装方式变化,现场应以实际采集与核验结果为准。
交互层与控制层:AI 应用痕迹的两张地图
交互层回答“围绕什么任务发生了什么”:会话、项目、工作区、附件、浏览器/WebView、连接器和输出结果都属于这一层。控制层回答“哪些能力在何种状态下可能被调用”:目标、任务图、模型设置、记忆、工具、自动化、策略和外部控制面都属于这一层。两层共同构成一个能够解释 AI 应用活动的审查地图。
03
从目录盘点到证据关系:AI 应用审查的四步法
仅罗列“发现了多少 JSON、多少日志、多少数据库”不能回答案件中的关键问题。MyHex AI Forensics 研究将可见痕迹收束为四个连续步骤,使每个技术发现都能回到明确的来源与边界。
-
发现与固定
按应用适配器识别应用身份、数据根、工作区、日志、数据库与侧车文件,并记录采集时间、运行状态、定位信息与文件级哈希。
-
结构化解析
把会话、任务、文件、插件、配置、输出和浏览器态转化为统一的结构化痕迹档案,而不是停留在目录列表。
-
时间与来源关联
区分创建、修改、访问、启动、任务、日志、下载和导出等时间语义;只有关联字段存在时,才把应用、任务、文件与输出连成关系。
-
状态链与人工复核
以“观察到、已配置、已启用、已调用、已成功”呈现能力或行为线索,并把待补材料、核验点和风险提示交给专业人员确认。
把哈希、时间与来源放在同一张审查表中
真正可复核的技术审查,不是把哈希值、时间和文件路径分散在不同附件中,而是让每条发现都能回答四个问题:它来自哪里?何时产生?是否可以与其他材料交叉印证?固定副本是否保持一致? 当来源材料缺失、时间矛盾或哈希无法对应时,系统应明确显示“待补材料”“待核验”“来源存疑”或“存在风险”,而不是生成貌似确定的结论。
04
MyHex 的插件化解法:把 AI 痕迹变成可审查的工作流
这项研究不准备另做一个孤立的 AI 取证产品。它的方向是成为 MyHex 内部一组独立版本、可复用、可验证的插件能力:在 MyHex Desktop、MyHex CLI、MyHex Agent 与 FinDr 的不同工作流中共享同一份结构化技术内核。
应用身份、数据根、数据库、日志、工作区、配置与输出。
按应用识别保存面,输出统一字段、时间、来源、哈希与状态。
把发现、缺口与矛盾显性化,保留每项结论的技术依据。
帮助调查、法务与律师更快定位材料、补齐链条并组织审查意见。
对使用者而言,MyHex 的价值不在于替代判断,而在于把原本分散、隐藏、难以解释的本地状态,转化为一条可查看、可排序、可比对、可复核的路径。专业人员仍然决定哪些材料进入分析、哪些线索得到确认、哪些结论可以写入报告。
05
它将如何改变电子数据审查工作
AI 应用的痕迹并不会自动形成案件事实,但它们常常提供理解“信息如何被组织、任务如何被推进、文件如何被流转”的关键技术线索。MyHex 的目标是让这些线索首先变得清楚、可信和可复核。
为调查人员节省定位时间
从复杂用户目录中识别高价值保存面,优先固定数据库、日志、工作区、侧车文件与输出物。
为律师和法务提供看得见的技术问题
以时间、来源、哈希与状态展示缺口,帮助区分“已有材料”“仍待核验”和“需要补充的文书或副本”。
为组织建立面向 AI 的数据治理视角
通过工作区、连接器、插件、浏览器和输出物的关系图,理解 AI 应用可能形成的数据留存面与审查重点。
06
研究边界:技术事实先行,不夸大、不越权
本公开论文总结的是六类样本的元数据研究、结构化建模和合成验证方向。当前研究没有读取未授权真实案件原始材料、会话正文、令牌、账号或私密文件;没有把目录、配置或工具包的存在扩大为具体行为;也不以自动化结果替代法律判断或正式鉴定意见。
正因为坚持这种边界,MyHex 才能把 AI 应用审查建立在可解释、可验证、可审计的技术事实之上。对复杂电子数据而言,克制不是能力的限制,而是专业可信度的基础。
结语
让 AI 时代的电子数据,仍然能够被专业地看见、理解和复核
AI Agent 正在进入每一个真实工作流,也正在形成新的本地数据现场。MyHex AI Forensics 希望做的,是在技术快速变化时,为调查、审查和治理提供一套稳健的方法:先固定事实,再建立关系;先解释依据,再讨论结论;让专业人员始终掌握审查流程的主动权。
联系 CFLAB 云迹,讨论 MyHex 应用