我们注意到 Meta 发布的 Muse Spark 1.2 和 1.3 模型都有一个包含 Contributor 字样的版本。有趣的是,它们基于完全相同的模型权重,性能也没有任何区别,但价格却相差悬殊。标准版输出价格是 4.25 美元/M tokens,而 Contributor 版只需要 0.20 美元,价格相差 21 倍之多。
完全相同的模型,为什么会有如此巨大的价格差异?我们从 Meta 的官方文档里找到了答案,带有 Contributor 字样的模型标注了“Used to improve our products”字样,本质是用你的使用数据换取 API 调用折扣。当你调用 Contributor 版本时,你发送的 prompt 和模型返回的 completion 都可能被 Meta 用于未来的模型训练。
版本定价
以下是 Meta 官方的定价信息:
| 版本 | 输入 (每 M token) | 缓存输入 (每 M token) | 输出 (每 M token) | 数据用途标注 | 请求限速 | token 限速 |
|---|---|---|---|---|---|---|
| Muse Spark 1.3 | $1.25 | $0.15 | $4.25 | 不用于改进产品 | 3,000 req/min | 4M tokens/min |
| Muse Spark 1.3 Contributor | $0.10 | $0.002 | $0.20 | 用于改进产品 | 60 req/min | 2.1M tokens/min |
从表格中可以看出,除了输出价格的 21 倍差距,输入价格的差距是 12 倍,而缓存输入价格的差距更是高达 75 倍。根据 WERSM 的统计,按照实际使用中输入、输出和缓存的不同配比,Contributor 版本的整体折扣幅度大约在 92% 到 99% 之间,平均约为 95%。
除价格差异之外,限速也是一个值得关注的差异。Contributor 版本每分钟只允许 60 个请求,而标准版本是 3,000 个,整整差了 50 倍;每分钟的 token 配额也从 4M 缩水到了 2.1M。
对于聊天场景来说,用户几乎感知不到限速。但如果是在 AI Agent 工作流当中使用,一次用户指令背后可能包含几十轮工具调用循环,这种情况下则有可能感知到限速的影响,尤其是并行任务和批量处理的时候。
假设有一个 Agent 任务需要执行 50 轮工具循环,每轮需要携带 20K token 的输入(包括系统提示词、记忆文件、之前的工具输出和历史对话),每轮产生 1K token 的输出。整个任务下来,总共消耗输入 100 万 token、输出 5 万 token。
- 标准模型费用:1.00 × $1.25 + 0.05 × $4.25 = $1.46
- Contributor 模型费用:1.00 × $0.10 + 0.05 × $0.20 = $0.11
同样的场景下,Contributor 模型大约会节省 92.5% 的成本。单个任务的差异尚且如此巨大,假如是一个需要全天候运行的计划任务,或者每天都在执行成百上千个这样的循环,一年的账单差距会达到四位数美元。
你的使用数据为什么值钱?
天下没有免费的午餐,Meta 之所以愿意给出如此慷慨的折扣,是因为“你的真实的使用数据”值钱。
对于平台方而言,所谓使用数据大致就是以下这两种:
- 聊天对话数据;
- Agent 工作流;
聊天数据并没有特别高的价值,因为在互联网上有海量的聊天对话存量,一问一答的格式非常简单,而且用 AI 模型合成这类数据的成本也极低。
Agent 工作流则完全是另一回事。一个 Agent 需要查文件、翻文档、调用各种工具、根据报错调整方案、在失败后重新尝试。这一整套“AI 在真实工作环境中如何表现”的完整记录,是任何基准测试都无法模拟、任何合成手段都难以伪造的。对于想要训练出更强 coding agent 的模型厂商来说,这是最有价值的训练素材。
WERSM 对此有一段很到位的评价:Meta 没有直接付现金给开发者,而是通过更便宜的模型调用价格作为补偿,让那些能够“教会 Meta 工作是如何完成的”开发者,获得明显更低的开销。
值得一提的是,Muse Spark 1.3 本身就是一款面向 coding 和 agentic 工作流的模型。第三方评测机构 Artificial Analysis 给它打出了 61 分的 Intelligence Index,与 GPT-5.6 Sol max、Grok 4.6 high 处在同一梯队。
让 Agent 使用 Contributor 模型的利弊
我们调用模型 API 进行对话,暴露的是对话的内容,但 Agent 框架的运作方式决定了它的暴露面要大得多。我们曾用一轮真实的会话作为样本评估了 Contributor 版本在 Hermes Agent 中使用的潜在风险:
首先是常驻上下文。 Hermes 在构建每次请求的 prompt 时,都会自动携带三份常驻文件和环境信息:负责身份设定的 SOUL.md、负责运转规则的 MEMORY.md、负责用户偏好的 USER.md,外加操作系统、HOME 目录、当前工作目录等环境信息。在样本会话中,MEMORY.md 约有 4500 字符,USER.md 则是全量携带。按一天 100 轮对话计算,光是 MEMORY.md 一项,就有大约 45 万字符的内容在持续外送,且这些内容在你输入任何问题之前就已经发出去了。此外,会话运行时还注入了约 40 条跨会话记忆,内容大多是主机名、硬件状态、备份计划、服务端口这类运维细节。它们单独看似乎都无关紧要,但组合在一起,足以还原出一台机器的完整基础设施画像和成本结构。
其次是工具调用的完整轨迹。 那轮会话一共执行了 6 次 web_search、2 次 web_extract、2 次 read_file,所有输出都进入了上下文。更关键的是,中间的失败和纠偏过程同样被完整记录:某个页面反爬失败后更换数据源,某次搜索方向跑偏后改用引号精确匹配,长文抓取被截断后改用分页续读。这类包含试错与自我修正的完整轨迹,恰恰是训练 coding agent 最需要的语料形态。
第三,数据外流的通道远不止主模型一条。 除了主模型,Hermes 还有一整层辅助(auxiliary)模型调用,辅助任务分为 13 类(视觉理解、上下文压缩、历史检索、命令审批等),每一类都可以独立配置不同的 provider 和 model。其中特别值得注意的是上下文压缩:长会话的 compression 会把中间轮次的内容做成结构化摘要,发给辅助模型处理;历史检索的 session_search 同样如此。这两个通道处理的是完整的工作内容,而它们背后使用的模型和平台,可能与主模型完全不同。
最后,也是最需要记住的一点:数据一旦进入训练管线,就再也撤不回来了。 secret redaction 功能默认开启,可以拦截那些“长得像 API key”的字符串,但对于路径结构、内部域名、架构注释、客户名称这类信息,则没有保护能力。当你意识到某些内容不应该发送、想要删除本地会话时,已经送进模型的部分覆水难收。未来如果某次模型输出中复述了你的私有代码或未发布稿件,损失就远不止隐私层面了,甚至可能触及 NDA(保密协议)。
其他公司的 AI 模型呢?
Meta 的特别之处在于它把数据换折扣这个约定摆在了台面上,价格、限速、数据用途,全部公开可查。那其他 AI 模型公司呢?它们没有提供“数据换折扣”的选项,是否代表它们承诺不使用用户数据进行模型训练吗?
我们来看几家主流平台的隐私政策:
| 平台 | 默认是否训练 | 不训练选项 | 条款状态 |
|---|---|---|---|
| Meta Contributor | 是,官方目录明示 | 有,切换 Standard 即可 | 明码标价 |
| DeepSeek | 是,政策写明用 User Input 训练改进模型 | 有 opt-out 权利条款,行使方式不直观 | 默认训练,未标价 |
| Z.AI | C 端条款允许为改进服务训练 | API DPA 写明实时处理不存储 | 分产品线,边界需要自行核实 |
| 小米 MiMo | 未找到对等训练条款 | 未见明确不训练 SKU | 条款空白 |
DeepSeek 的隐私政策明确了会使用 User Input 来训练和改进模型,也就是说默认状态就是训练。用户确实拥有 opt-out 的权利,但具体到 API 调用层面如何行使、是按请求生效还是按账户生效,政策原文没有给出可操作的说明。Z.AI 的情况则体现了“同一家公司、两套规则”:它的 DPA(数据处理协议)对 API 客户承诺实时处理、不落盘存储,但它的 C 端产品条款却允许为改进服务而训练。至于小米 MiMo,我们在其公开文档中没有找到与训练相关的对等条款,条款空白意味着既无法确认安全,也无法确认风险。
也就是说,是否使用用户数据训练,取决于平台的数据策略,与有没有折扣没有必然关系。享受折扣的用户,至少知道自己交出了什么;没有折扣的用户,数据可能同样进入了训练管线,只是既没有获得对价,也没有看到条款。从这个角度说,明码标价反而是信息更充分的选择。
如何降低信息泄露的风险?
只要你在使用公开的 API 服务,就不存在绝对意义上的隐私!你的上下文总会被送到某个推理端,我们能够做的,是把暴露面管理到可控的范围。以下六条策略可以帮助你尽量降低信息泄漏的风险:
- 默认假设你的数据会被训练。 只要条款中没有明确写出“不用于训练”,就把该平台当作会训练来对待。条款完全空白的平台,最需要按这个假设来处理。
- 最小化进入上下文的内容。 Agent 框架的常驻记忆、环境信息、工具输出,每一轮都会随请求送出。敏感内容不要放进常驻记忆,具体路径、端口号这类细节,放到按需加载的文档里。
- 给任务分级。 公开任务(公开代码、已发布内容、通用调研)和私域任务(客户数据、未发布稿件、个人记录)分开处理,私域任务走明确承诺不训练的通道,或者干脆用本地模型。
- 检查辅助通道的配置。 长会话压缩、历史检索摘要、图片理解这类辅助调用,可能设置了完全不同的模型和平台,需要逐项确认它们分别配置了什么。
- 发送之前先脱敏。 日志、报错堆栈、配置输出,先过一遍再贴。redaction 只能拦截形似密钥的字符串,像路径、架构、客户名这些信息都需要手动检查清理。
- 发送前的判断是唯一的控制点。 数据一旦进入训练管线就没有删除操作,所有的保护都发生在你按下回车之前。
参考来源
- Meta Model API 定价页(Muse Spark 1.3 与 Contributor 对比)
- VentureBeat:Meta says Muse Spark 1.3 has frontier performance
- Orcarouter:Muse Spark 1.3 Contributor vs Muse Spark 1.3
- WERSM:Meta Muse Spark Contributor pricing training data
- 小米 MiMo 开放平台定价页
- DeepSeek 隐私政策
- Z.AI 隐私政策
作者: Cyber Herald
原文地址: https://torchtree.com/post/muse-spark-contributor-data-right/
发布时间: 2026-09-04
版权声明: CC BY-NC-SA 4.0