首页 > 教程资讯 > 教程详情

哈佛 MaDSys 公开 FreeInference agent 轨迹数据集:1.2 万个会话,供缓存与调度研究

AI 与前沿 老K说软件 2026-10-09
文章分享

哈佛大学 MaDSys 团队发布了 FreeInference Agentic Trace 数据集,记录用户通过 FreeInference 使用编码类和助手类 agent 时的请求时间、token 用量和工具调用。数据集不含对话内容,面向 KV 缓存、批处理和调度等推理服务研究,可用来回放前缀缓存行为。

数据规模与下载方式

数据覆盖 2026 年 5 月 17 日至 9 月 5 日共 16 周,来自 267 个账户。发布文档报告了 14 种 agent 框架、12,002 个 agent 会话、1,186,582 次模型请求和 1,213,347 次工具调用。

数据集记录约 2090 亿输入 token。这是各次请求输入量的总和,包含会话中反复发送的上下文,并不是 2090 亿个互不相同的 token。

数据提供两种形式:原始 JSONL 轨迹解压后约 108 GB,扁平化 Parquet 表约 9 GB。数据集及配套材料采用 CC BY 4.0 许可,仓库要求引用论文《From Requests to Sessions: A Large-Scale Characterization of Human-Driven Agentic Workloads》。

不含文本,保留前缀结构

请求输入被表示为 16-token 的链式前缀块,使用 tiktoken 的 o200k_base 分词。发布内容不含消息、提示词、回复和工具结果文本,所以研究者可以追踪共享前缀,却无法重跑原始任务。

研究者报告的三项发现

以下均为研究团队自己报告的结果,所给来源没有显示独立复现。

  • 成本:在缓存输入、未缓存输入、输出的相对价格为 1:10:50 的假设下,缓存输入是 72% 会话中最大的成本项。结论依赖这一价格假设。
  • 延迟:模拟显示,工具耗时减半使会话加速 1.38 倍,预填充减半为 1.09 倍,解码减半为 1.16 倍。模拟排除了用户空闲时间,工具间隔上限为 15 分钟。
  • 上下文变更:4% 的请求会修改先前上下文,却占 62.5% 的新预填充。其中系统提示变更占 0.74% 的请求、26.9% 的新预填充;工具定义变更占 0.40% 的请求、13.9% 的新预填充。

使用时需注意

跨周边界的会话会被拆分,研究长会话的团队需要考虑这一点。文档本身也有不一致:仓库称覆盖 14 种框架,数据中心的描述称 13 种。

来源