Spirit Airlines 数据交易仍待美国破产法院批准;文中对 Agent 数据价值的判断,基于公开交易文件和行业材料作出。
Spirit Airlines 停止运营后,留下一项特殊资产:公司的内部数据。
8月14日,Spirit 完成这批数据资产的破产拍卖,Google 以 1000 万美元报价胜出。按照拟议交易,员工邮件、日历、聊天、文档、电子表格和运营记录等数据,将由第三方完成去标识化后再交付 Google。法院文件显示,其中约有 1 亿封邮件和 5 亿条 Microsoft Teams 消息。交易仍待破产法院批准,听证会定于8月19日举行。
邮件只是这批资产里最吸引眼球的一部分。
Spirit 的资产清单还包括 516 个源代码仓库、约 3000 万行代码、4.3 万多条 Pull Request 及相关审查记录、37.2 万多条完整 Git 提交历史,以及 Bug 讨论、自动化测试和 CI/CD 日志。运营侧则包括 IT 工单、收入和收益管理、飞机运行与物流、项目管理、交易、审计和财务数据。
Google 表示,这些企业数据可以帮助改进产品和 AI 模型。
1000万美元本身说明不了太多。比金额更值得关注的,是两家公司竞买了什么,以及交付数据时附加了哪些条件。
如果只是为了让模型了解航空业,互联网上并不缺航空公司的年报、运行手册、新闻、法规和公开数据。Google 为什么还愿意为一家倒闭航空公司留下的工作记录支付 1000 万美元?
一、真正值钱的,不是那1亿封邮件
Spirit 卖出的数据横跨沟通、代码、系统和运营等多个环节。更关键的是,Spirit 与买方的交易文件明确要求,去标识化过程在符合相关标准的同时,要尽量保留整个数据集的 referential integrity,也就是数据之间原本的引用和关联关系。
这意味着,去掉个人身份信息时,不能顺手把数据原有的上下文全部拆散。
比如代码提交和 PR、Bug、测试结果之间原本存在的关系,本身就有价值。至于邮件最终能否和项目、工单对应,业务动作能否继续和结果关联,交易文件没有披露,目前还不能下结论。
但至少从数据形态看,一批有关联的记录,和一堆孤立文本完全是两回事。
一封邮件只能告诉模型某个人说了什么。一组能够互相对应的记录,才有可能让模型看到一件事为什么发生、谁接手了任务、依据什么作出判断、哪里出现异常、方案怎样修改,以及最后什么结果才算结束。
现在已经有公司在专门寻找这类数据。
micro1 公开招募的企业数据就包括标准操作流程、知识库、CRM 数据、项目历史和质量检查流程,也包括团队怎样评估信息、作出运营决策。其页面强调,最有价值的数据应当反映真实的运营经验、决策过程和可重复工作流。
Forbes 今年4月也报道,SimpleClosure 等公司已经开始处理倒闭创业公司的 Slack 归档、Jira 工单、邮件和代码。报道提到,Sunset 衡量“数据丰富度”时,会看数据能不能跨平台追踪。一个能够和具体代码提交对应的 Jira 工单,价值就高于一份孤立文档。
原因并不复杂。SOP 写的是标准流程,历史记录则保留了事情实际怎样办完,包括信息缺失、系统报错、方案返工和临时决策等内容。而这些恰恰是自动化最容易出问题的地方。
由此看,企业数据的价值正从单篇文本,延伸到记录之间的关系。Spirit 的清单同时覆盖沟通、代码、系统和运营等多个环节。这些数据未必已经串成完整流程,但比一批彼此孤立的文本更适合用来还原任务过程。
不过,这些历史记录还不能直接用作 Agent 的训练集,仍要经过清洗、对齐和任务重建,才能变成训练样本或测试环境。Spirit 卖的是可供重建的底层记录,不是整理好的训练集。
二、Chatbot 要答案,Agent 要过程
早期大模型的主要任务,是根据问题生成答案。网页、书籍、论文、代码和人工问答等等,这些资料可以提供大量知识,让模型学会解释概念、补全代码、回答问题。那时的数据竞争,自然集中在更多文本和更高质量的答案上。
Agent 面对的却不是一道问答题。
核对一张发票、处理一次退款、完成一次采购、修改一份合同,或者排查一次服务器异常,都要连续打开系统、读取信息、作出判断、调用工具、处理失败,并在必要时把任务交给人。
Chatbot 面对的问题是:
一个优秀客服应该怎样回复客户?
Agent 要解决的是:
客户投诉以后,能不能把整个退款流程走完?
这两个问题需要的训练材料完全不同。互联网文本可以教模型怎样回答,完整办理退款还需要系统状态、权限限制、异常情况和完成标准。
Scale AI 今年介绍强化学习环境时提到,模型已经开始在模拟的企业软件和消费场景里学习工具使用、电脑操作和多步骤工作流。按 Scale 自己的统计,其近一半的新数据训练项目已经涉及这类环境。这个比例不能代表整个行业,但至少说明,训练对象正在从静态答案走向可执行过程。
Agent 要把事办完,就得把答案落实到系统操作中,还要学会在失败后调整,并判断任务何时完成。训练数据因此从“答案”延伸到了“过程”。
三、Agent 正在改变什么叫“有用的企业数据”
过去谈企业数据的价值,人们更关注数据量、客户覆盖、交易规模和独占性。这些因素仍然重要,但现在还要多问一句:这些记录能不能还原任务?
具体可以看四件事:
- 流程完整:只有最终合同,没有谈判和审批过程,AI 只能看到结果,看不到结果是怎样形成的。
- 跨系统关联:Jira、代码、测试记录各自独立存在,很难还原一个问题从出现、处理到解决的全过程。
- 结果可验证:没有成交、退款、回滚等反馈,模型无法判断任务到底做对没有。
- 难以替代:一家航空公司多年积累的定价、运营、软件开发和异常处理记录,很难从公开网页重新拼出来。
这类数据能迁移到其他行业,靠的不是航空规则,而是任务拆解、权限控制、异常处理和结果反馈等共通结构。具体业务规则仍要在各行业重新建立。
这也是许多企业大模型知识库目前缺的一层。过去两年,很多企业把最终文档整理好,让 AI 能搜索和回答问题,解决的是“公司知道什么”。Agent 还需要知道“公司怎么把事情做完”,因此还要留下必要的上下文,以及“决策—动作—结果”的过程记录。
AI-ready,不只是知识能不能被搜索,而是工作能不能被还原。
四、最值钱的关联,也是最难处理的部分
关联关系带来了价值,也带来了麻烦。
关联越完整,越有利于还原工作;但关联越完整,也越难真正匿名。
Spirit 的交易文件同时提出两项要求:交付前由第三方去标识化,去除或转换个人身份信息;处理中又要尽量保留整个数据集原有的 referential integrity,也就是引用和关联关系。去掉“这个人是谁”时,不能顺手把一次操作和相关记录的上下文全部拆掉。
去标识化因此不只是删掉姓名。关系全部打散,数据就失去训练和评估 Agent 所需要的上下文;关系保留得越多,重新识别个人和组织行为的风险也越高。
Spirit 的交易文件同时提出了两项要求。
一方面,数据交付前要由第三方完成去标识化,去除或转换个人身份信息;另一方面,处理过程中又要尽量保留整个数据集原有的 referential integrity。也就是说,去掉“这个人是谁”的同时,不能把相关操作、记录和上下文全部删掉。
去标识化因此不只是删掉姓名。关系全部打散,数据就失去训练和评估 Agent 所需的上下文;关系保留得越多,重新识别个人和组织行为的风险也越高。
竞价过程也说明,数据怎么处理,本身就是交易的一部分。
Mercor 一度提出 700 万美元方案,条件是先取得原始数据,再自行去标识化。最后,Spirit 选中 Google 的 1000 万美元方案,并把 Mercor 采用第三方去标识化的 750 万美元方案列为备选。
这场竞价比的不只是价格。谁能接触原始数据、谁负责去标识化、处理后的数据可以怎样使用,同样会影响交易结果。
这对普通企业也有启发。
以后设计 CRM、项目系统和内部 AI 时,一方面要考虑怎样留下足够的工作上下文,另一方面也要提前划清员工、客户和业务数据的使用边界。。
AI 想理解一家企业怎样工作,离不开完整的上下文;上下文留得越多,治理难度也越高。
结尾|真正的企业数据资产,可能一直藏在“过程”里
回到开头,Google 愿意出 1000 万美元,买的不是一套航空知识,而是一批可能用于重建真实工作过程的底层记录。这个价格只属于 Spirit 这次破产拍卖,不能拿来给所有企业数据统一定价。
真正值得注意的是背后的变化。
过去,大模型主要从互联网学习“世界上有什么”;Agent 进入企业后,还要学习“事情怎样做成”。
这类信息很少完整写在公开网页里。它们散落在工单、邮件、审批、CRM、代码提交、会议记录和一次次失败的项目中。
这些内容过去多半只是历史记录,甚至被当作数字垃圾。Agent 要进入真实工作后,它们开始有了另一层用途:还原公司怎样判断、怎样行动,又怎样把事情做完。
企业准备部署 Agent 时,不能只整理知识库,还要保留经过授权、能够复盘、结果可验证的工作上下文。
主要信源
- Spirit Airlines 破产法院文件:去标识化数据拍卖结果与拟议销售协议(2026年8月14日)
- Spirit Airlines 破产案案卷入口(含竞价程序和相关提交文件)
- Axios:Google wins bankruptcy auction for Spirit Airlines emails, chats, documents(2026年8月17日)
- Forbes:AI’s New Training Data: Your Old Work Slacks And Emails(2026年4月16日,4月17日更新)
- micro1:Monetize your company’s operational data(截至2026年8月18日访问)
- Scale AI:The Next Frontier of Data Training: RL Environments(2026年2月27日)
- The Register:Google buys crashed airline Spirit’s data at auction because AI(2026年8月18日)
信息截至2026年8月18日。Spirit 交易的破产法院听证会定于2026年8月19日,法院最终批准结果、实际交付范围和 Google 后续使用方式可能变化;本文关于 Agent 数据需求的部分,是基于公开产品、数据合作和训练环境材料作出的机制分析,不等同于 Google 已经验证了这套数据的模型收益。

