我的AI在for循环中从磁盘读取JSON 900次(为什么没有静态代码检查工具能拯救你)
上周,我的AI写了一段代码,每次都从磁盘读取一个JSON文件,对其解析后再进行一次查找,然后总共重复了900次。这意味着每次迭代里都会经历:打开文件,解码JSON,找到某个值,再全部丢弃从头开始。 这个错误是我在教学生编程的第一个月就会告诉他们千万不要犯的。 发生了什么事(长话短说) 我在开发Tokamak,一个用于macOS的菜单栏应用,用来监控Claude Max的配额使用情况。它的一部分功能需要扫描约900个Claude Code会话数据生成的JSONL文件(JSON Lines)。对于每个文件,它需要知道在上一次的扫描中读取的字节偏移量(增量读取——只读取新数据)。 偏移量都保存在一个JSON文件中: { "version": 1, "offsets": { "proyecto-a/sesion-1.jsonl": 48231, "proyecto-b/sesion-2.jsonl": 12044 } } --- 一个`Dictionary<String, UInt64>`包含了900条记录,约55KB,但并不算大。 但问题在于,更让人抓狂的是:**这个文件是应用自己生成的**。它不是来自于外部的API,也不是Claude Code交付的文件。这是Tokamak自己生成和读取的内部状态文件,用于记录每次扫描的会话进度。 “那你为什么不用Core Data或者SQLite呢?你应用里不是已经有这些东西了吗?”这是个好问题。原因是这个文件是一个**一次性缓存文件**。就算它被损坏了,只需要删除文件,下次扫描时重新读取整个文件即可,数据根本不会有任何丢失。而且我可以简单地用`cat session-offsets.json | jq .`来进行调试(用Core Data的话就需要用`sqlite3`并进入沙盒路径),这也是一个`Sendable`数据结构,不需要来回折腾的后台事务。并且,如果Core Data的SQLite文件损坏了,也不会影响这个偏移量的存储(反过来也是如此)。对于一个只有55KB大小的扁平字典,去创建一个支持schema迁移的实体未免有些大材小用。 所以问题并不是格式,而是**访问方式**。 以下是AI生成的扫描循环代码: ```swift for file in files { // 900个文件 let storedOffset = offsetStore.offset(for: file.relativePath) // ↑ 每次读取和解析磁盘上的JSON文件!!! if file.fileSize == storedOffset { continue } // ... 读取文件,更新偏移量 ... offsetStore.setOffset(newOffset, for: file.relativePath) // ↑ 再读一次,同一个JSON文件,然后修改并保存。 } 每次迭代读两次磁盘,共900次迭代。这意味着总共有1,800次I/O操作,原本应该只需要2次:一次读取和一次写入。 ...