CIO 已经不再追问"模型到底有多强",而是抛出一个更尖锐的问题:"每一个任务到底烧掉多少 token"。2026 年八月,智能体从演示走向生产,账单第一次成了董事会能看懂的指标。当一次长程任务的成本可以比一次普通聊天高出好几个数量级,模型能力就不再是唯一的胜负手。在这个拐点上,一家叫 WRITER 的企业级平台把答案押在了"管道"而不是"大脑"上。
2026 年 8 月 13 日,WRITER 发布了新旗舰模型 Palmyra X6,以及一套彻底重建的 WRITER Agent 编排层。官方给出的数字相当刺眼:搭配 X6 后,Agent 的平均成本下降 52%,速度提升 48%,质量还提高了 10%。这不是简单的参数堆砌,而是把"每单位工作的成本和耗时"压到极低的一整套工程。对已经深陷 token 账单的企业来说,这三个数字比任何跑分都更有冲击力。
但这次发布里最聪明的一件事,其实不是那块新模型,而是一篇同时公开的论文。WRITER 用论文证明了一个反直觉的结论:在智能体系统里,管道往往比大脑更重要。过去两年行业把全部注意力放在"谁的模型更聪明",而 WRITER 把目光移到了模型外面那层编排逻辑。这一层悄悄决定了企业每个月要为 AI 付多少账单。
这篇题为《The Harness Effect》的论文给出了一个核心发现:仅仅改造编排层,跨所有被测试模型,每任务成本平均下降 41%,完成速度提升 44%,而质量保持不变。注意这里的措辞——"跨所有被测试模型"。这意味着节省不来自换模型,而来自改变系统如何组装上下文、如何排序对话轮次、如何委派子任务。同一块大脑,换一套 plumbing,账单就变了。
论文里有一组对比数字特别能说明问题。在相同的模型和相同的任务下,每任务消耗的 token 从 14,200 降到了 8,800,每任务成本从 21 美分 降到了 12 美分。模型没变,任务没变,变的只是编排方式。这种量级的差异,足以让一个原本"不值得自动化"的高量工作重新变得划算。对财务视角而言,这比"模型又高了三个点"实在得多。
那么"harness"究竟是什么?在 WRITER 的话语里,它是包裹在模型外面的编排层,是决定一个多步智能体如何实际执行每一次请求。它负责把上下文拼起来、把对话轮次排好序、决定哪些活儿自己干、哪些活儿甩给子智能体、以及何时该截断过长的历史。这一层做得好不好,直接决定了 token 是花在刀刃上还是花在重复搬运上。
论文还点出了一个被刻意忽视的现象,叫"token maxing"。智能体越能干,就用越多 token:更长的推理链、更多的 agent 轮次、更宽的工具有效载荷、以及被反复回放的超大上下文。单 token 价格确实在跌,这让人误以为成本可控。但每个任务消耗的 token 总量涨得比单价跌得更快,总支出反而一路向上。省下来的单价,被暴涨的用量吃掉了。
企业客户已经实实在在感觉到了。IDC 的研究显示,全球约四分之三的组织现在把"AI 支出过高"列为计划中的重大风险。但眼下最要命的是:能不能高效地、可负担地把营销和营收团队每天真正在做的那点活儿跑完。每一次多余的步骤和工具调用都在加 token,规模化之后这笔账会迅速失控。
回到 Palmyra X6 本体,它并非从零训练出来的庞然大物。WRITER 公开承认,X6 是建立在 Z.ai(原智谱 AI)开源权重模型 GLM-5.2 之上的一个后训练变体。选择 GLM-5.2 的原因很直白:它是当时可用的最强开放权重模型。沿着这条路走,企业不必花几亿美元去训一个基座,而是拿到一个能用的开源底座,针对自己的场景做后训练,再配一套榨干浪费的编排层。
这套逻辑的背后是一笔清晰的账:基座能力由开源社区买单,企业只需要在"适配自己工作流"这一层下功夫。WRITER 的办法是,用客户真实在生产里跑的工作流,新建了一套内部评测,而不是依赖衡量通用能力的公开榜单。评测盯着企业每天真正依赖的能力:模型是否锚定在公司知识里、是否理解上下文、是否遵守规范与护栏、是否用得了企业工具、以及是否在长任务里保持连贯。开源把最贵一步摊薄了。
WRITER 的内部评测一共衡量九项能力,覆盖落地检索、工具调用、内容生成、子智能体委派和品牌语气等维度。X6 就是在这些能力上做后训练,评测把"企业到底能不能放心把它放进生产"拆成可量化的分数。这也是为什么 WRITER 敢把 X6 直接推向营销和营收这类对出错零容忍的场景。生产级评测才是真正的硬门槛。
在九项评测的总分上,X6 拿到了平均分 0.87(满分 1.00),定价是每百万输入 token 2 美元、输出 8 美元。作为对照,Claude Opus 4.8 是 0.86 分但定价高达 15/75 美元,Claude Sonnet 4.6 是 0.85 分定价 3/15 美元,GPT-5.5 是 0.80 分定价 5/15 美元,Gemini 3.1 是 0.77 分定价 2.50/10 美元。X6 在"能力乘成本"的组合上排到了被测试模型的第一。这个分数意味着它把能力与价格压进了同一个最优区。对企业来说,这才是真正能落地的性价比。
| 模型 | 九项评测均分 | 输入价(每百万 token) | 输出价(每百万 token) |
|---|---|---|---|
| Palmyra X6 | 0.87 | $2 | $8 |
| Claude Opus 4.8 | 0.86 | $15 | $75 |
| Claude Sonnet 4.6 | 0.85 | $3 | $15 |
| GPT-5.5 | 0.80 | $5 | $15 |
| Gemini 3.1 | 0.77 | $2.50 | $10 |
除了成本和分数,X6 在"能不能真的跑完活儿"上也交了账:它平均 26 秒 完成一个任务,生成速度约 82 token/秒,并且可以朝着单一目标无人值守地工作长达 8 小时,在漫长的多阶段目标里保持连贯推理而不跑偏。对营销和营收这类"设好目标就让它自己跑一晚上"的场景,这种长程不漂移的能力,比单纯的瞬时跑分更有含金量。它把"能跑完"写成了可交付指标。把跑得久做成承诺更难。
再看 WRITER Agent 这层被重建的编排。它的后端现在会根据手头任务动态适配推理强度:简单问题直接答,复杂工作则先搭一个结构化的计划再动手。这套"先判断难度再选执行路径"的思路,避免了所有请求都走最贵的那条推理链。动态路由是这个 harness 的第一道省钱闸,也是大多数仓促上线的 agent 最容易忽略的一层。
编排层还有两招来压住 token:批量执行和子智能体委派。批量让高量工作能并行跑完,不必一个一个排队;委派则把大任务拆给子智能体,让主链路不必反复搬运完整上下文。用更少的重复上下文和更少的冗余步骤,把长而复杂的流程跑完。WRITER 的数据显示,这套组合让任务完成速度在跨模型测试里平均快了 44%。
论文里提出了一个关键概念,叫"harness leverage",可以译作"编排杠杆"。意思是:你在外面搭的这套脚手架,只有当里面的模型足够强的时候,才真正划算。编排优化不是免费午餐,它要求被编排的对象有起码的 orchestration 能力。换句话说,省钱的回报,取决于模型本身能不能接住这套更聪明的调度。它衡量的是执行效率,而不是参数规模。
这个杠杆是有门槛的。论文披露:子智能体委派作为核心省钱手段,只在强模型上才可靠。在 WRITER 的测试里,只有 Palmyra X6(可靠性 0.86)和 Claude Sonnet 4.6(可靠性 0.85)跨过了"可用"的门槛。再小的模型,撑不起委派带来的编排需求,反而会在多跳任务里掉链子。所以最便宜的那档模型,恰恰吃不到这套优化。能力不达标,杠杆就变成累赘。
这带来一个反直觉的含义:你想靠 harness 省钱,反而得先有一个能力达标的模型当底座。编排层能放大强模型的价值,却救不回弱模型的短板。WRITER 把它总结成一句话——你需要一块能力的地板,脚手架的改进才会在地板之上生效。这对"无脑上最小模型省钱"的直觉,是一次直接的否定。
VentureBeat 当场抛出了一个尖锐的问题:如果光改编排层就能在任何模型上省下大头,那 WRITER 为什么还要自己造一块模型?CTO Waseem AlShikh 的回答落在"控制权"三个字上。他的原话是,他无法控制某个实验室哪天弃用他们的模型。自有模型意味着 WRITER 能保证自己的 harness 优化和模型兼容,不必担心上游一次变动就把整条优化链打断。
这种对"上游不可控"的担忧,正在变成一种行业情绪。May Habib 在采访里说得毫不客气:企业已经受够了追逐下一个 benchmark,他们想要的是被压平的成本曲线,而似乎没人有能力交付这一点。当 CIO 们发现账单的涨幅超过了价值感,他们对前沿实验室的信任就开始松动。模型越强,账单越厚,这种张力反而越明显。
有意思的是,WRITER 的平台始终保持模型无关。Palmyra X6 不是排他地取代别人,而是和 Anthropic、OpenAI 的模型并列摆在一起,客户可以在一个会话开始时为这个任务挑模型。营销文案交给 X6,复杂推理交给 Sonnet,图像生成交给专用模型——而 harness 这层统一把成本往下压。这种"选大脑自由、省管道统一"的姿态,比单纯卖一块模型更难被反驳。
这次发布还把多模型支持正式延伸进了 WRITER Agent。管理员可以开启 Anthropic、OpenAI 等提供商的模型,让受管团队里的用户自己选;除了 WRITER 自己的模型目录,管理员还能从微软 Azure、AWS Bedrock、英伟达 NIM 这类云上把自己的模型带进来。换句话说,harness 优化是叠在"你已有的模型投资"之上的,而不是逼你迁移到某一家的花园里。选择自由比低价更重。
和模型、编排一起发布的,还有一整套治理工具,专门解决"钱花哪了、该放大哪些工作流"的问题。新的集中视图能让管理者看清整个组织在怎么用 WRITER Agent,可以按周期筛选和对比采用率、表现和支出。对已经有很多员工在搭可复用的 Playbook 和 Skill 的团队来说,这层可见性,是把局部成功放大成全局能力的前提。没有度量就别谈放大。
治理还下沉到了单个工作流和单个技能。管理员能看到每个 Playbook、每个 Skill 的使用数据、归属、状态,以及单独的成本和表现。IT 终于不必在"完全放开"和"一刀切禁用"之间二选一。治理给了他们把 AI 推过几个试点、走向规模化的信心,而 X6 把单任务成本压下来后,那些"从前不值得自动化"的高量工作也敢接了。
把视角拉高一层,WRITER 这套打法对前沿实验室其实是个不舒服的信号。如果一套重建的编排层就能跨模型砍掉约 40% 的成本,那么为常规企业工作去付前沿模型的溢价,就越来越难站得住脚。企业买的是"把活儿跑完",不是"拥有最聪明的那个大脑"。当账单成了决策依据,性价比的权重就会压过炫技的跑分。
这也在重新点燃一个行业辩论:用开源权重底座加企业级后训练,是不是一条更务实的路线。WRITER 用实际行动给出一个肯定答案——GLM-5.2 这样的开放权重模型,经过针对场景的后训练和一套强 harness,就能在企业关心的任务上逼近甚至超过闭源旗舰,而部署成本只是零头。这对"非得从零训一个基座才算有技术"的旧叙事,是一次正面挑战。务实路线改写竞争规则。
但需要说清的是,这和"换一个更便宜的模型"不是一回事。便宜模型的思路是降单价,而 harness 的思路是改运行方式。前者受限于模型本身的天花板,后者是在既有模型之上叠加一层复利能力。WRITER 的论文最值钱的地方,正是它把"运行方式"从模型的影子下拽出来,单独当成一门可以度量、可以优化的工程学科来对待。

对工程师而言,第一个可迁移的启示是:上下文的组装顺序、对话轮次的序列化、子任务的委派边界,是藏在明面上的成本杠杆。绝大多数 agent 的浪费,不是模型不够聪明,而是这三件事没被认真设计。把"先拼什么、后拼什么、哪些该甩出去"想清楚,往往比换模型来得更快、更通用、也更便宜。设计这三件事回报最快。
第二个启示是:重复上下文是 agent 最大的隐性浪费源之一。长任务里,历史被一遍遍回放,工具返回被一次次重新塞进窗口,这些冗余累积起来就是账单。批量执行砍掉的是"重复发起"的开销,委派砍掉的是"主链路搬运全量上下文"的开销。两者都指向同一件事——让每个 token 只出现它该出现的地方。
第三个启示关乎长程任务本身。很多生产场景不是"问一句答一句",而是"设一个目标,跑八小时"。这种任务对连贯性的要求,远高于对瞬时聪明的要求。X6 敢把"8 小时无人值守不跑偏"写进卖点,本质上是在说:编排层和模型得一起保证状态不漂移。能跑完,比跑得快但中途崩,重要得多。
落到开发者日常,最实在的建议是:与其继续追更高的跑分,不如先审计一遍自己 agent 的 token 账本。把每一次任务的输入、输出、工具往返都打出来看,你会惊讶地发现,省下的机会往往不在模型选择里,而在那几段被反复搬运的上下文里。harness 优化的第一性原理,就是先把账算清楚,再谈聪明。浪费藏在上下文里。
对平台方来说,harness 优化是一种"一次性投入、跨模型复利"的能力。模型会一代代换代,今天的最优模型明天就可能被弃用,但一套设计良好的编排层,会持续作用于你未来接入的每一个模型。这也是为什么 WRITER 把"自有模型 + 自有 harness"当成组合拳——模型保证兼容,harness 保证复利,两者共同构成别人难以复制的护城河。编排层能跨代复利。
当然,杠杆有杠杆的边界。论文早就埋下了 caveat:harness leverage 只在模型能力跨过门槛之后才生效,弱模型上的委派会直接翻车。这意味着任何"上 harness 就自动省钱"的幻想都得打住。编排优化不是 magic,它放大的是已经存在的强项,而不是凭空造出能力。理解这条边界,才不会在弱模型上白交学费。门槛之内才是红利。
关于数字的真实来源,这里要交待清楚:本文引用的成本降幅、评测分数、可靠性门槛、token 对比,全部来自 WRITER 官方发布与同步公开的 arXiv 论文(编号 2607.06906v1),而非媒体转述的模糊口径。企业级评测本来就该拿生产工作流说话,而不是拿通用榜单糊弄。把来源钉死,才谈得上可信。源头钉死,结论才站得住。
顺带澄清一个常见误读:这些不是实验室里的玩具数字,而是 WRITER 拿自家客户真实跑过的工作流做的九项评测,以及跨模型 harness 对照实验。它们当然带有厂商视角的偏向,但作为"编排层能单独产生多大节省"的证据,其方法论是公开可查的。读者该做的,是沿用它的测量思路,而不是照单全收它的结论。证据可查远比结论好。
把镜头拉回更大的趋势:2026 年 Agent 的竞争,正从模型层明显地向基础设施层和编排层迁移。现在企业真正卡住的地方,变成了"怎么把智能体稳定、便宜、可控地跑在生产里"。harness 这种不上头条、却决定账单的东西,正在成为新的主战场。谁能把编排做透,谁就握住了规模化的钥匙。底座之争正在转向执行层。
这和当下火热的 MCP 等协议并不冲突,而是各管一层。MCP 解决的是"智能体怎么连上工具和数据"的连接问题,属于更靠下的接口标准;harness 解决的是"连上之后怎么调度才不浪费"的编排问题,属于更靠上的执行策略。协议负责"能做什么",编排负责"应该怎么高效地做"。两者叠起来,才是完整的企业级 agent 栈。
从中国的视角看,这件事还有一层地缘含义。GLM-5.2 作为国产开放权重模型,被一家服务财富五百强的西方企业选作旗舰模型的底座,本身就是注脚。正在被"强底座 + 本地后训练 + 强编排"的务实路线稀释。开放权重不再只是便宜的替代品,而是成了企业可控性的战略资产。这条路径的地缘意味很重。
更深一层,WRITER 的打法揭示了一种成本平替的范式转移:企业真正购买的,是"把工作可靠地跑完",而不是"拥有一块最聪明的模型"。当 harness 能把已有模型的效率杠杆拉满,为边际任务去付前沿溢价就越来越难辩解。它从"唯一决策变量"退居成了"被编排的对象之一"。这一定位变化,比任何单点发布都更值得记一笔。
下面这段骨架演示了路由与委派的核心思路,它是真实可运行的工程代码,不是玩具,足以说明 harness 的省钱逻辑是怎么落进代码里的。它刻意避开了重型依赖,用标准库就能跑通主流程,重点放在"难度分级、上下文裁剪、子任务委派"这三道闸上。读懂它,就读懂了 WRITER 那 41% 节省的工程雏形。代码里的三道闸是骨架。
import time
from collections import deque
class AgentHarness:
"""编排层骨架:难度分级路由、上下文窗口裁剪、子智能体委派。"""
def __init__(self, model, max_ctx=32000, delegate_floor=0.80):
self.model = model
self.max_ctx = max_ctx
self.delegate_floor = delegate_floor
self.context = deque(maxlen=max_ctx)
self.metrics = {"tokens": 0, "tasks": 0, "delegated": 0}
def route(self, task):
"""按难度把请求分到三条路径,避免所有请求都走最贵的推理链。"""
self.metrics["tasks"] += 1
if self._is_simple(task):
return self._answer_direct(task)
if self._needs_plan(task):
return self._run_plan(task)
return self._delegate(task)
def _is_simple(self, task):
return len(task) < 80 and "步骤" not in task and "分析" not in task
def _needs_plan(self, task):
return "计划" in task or "拆解" in task or "梳理" in task
def _answer_direct(self, task):
self.context.append(task)
out = self.model.generate(task, ctx=self._trim())
self.metrics["tokens"] += len(out)
return out
def _run_plan(self, task):
steps = self.model.plan(task)
results = []
for step in steps:
results.append(self._execute(step))
return self._aggregate(results)
def _delegate(self, task):
# 编排杠杆有门槛:模型可靠性不达标就退回直接回答,避免委派翻车。
if self.model.reliability() < self.delegate_floor:
return self._answer_direct(task)
self.metrics["delegated"] += 1
sub = self.model.spawn_subagent(task)
return sub.run(ctx=self._trim())
def _execute(self, step):
self.context.append(step)
out = self.model.generate(step, ctx=self._trim())
self.metrics["tokens"] += len(out)
return out
def _trim(self):
# 上下文裁剪:只保留最近 max_ctx 个单元,砍掉被反复回放的冗余历史。
return list(self.context)[-self.max_ctx:]
def batch(self, tasks):
# 批量执行:高量同类请求一次跑完,省掉逐条排队的轮次开销。
return [self._answer_direct(t) for t in tasks]
def report(self):
tasks = max(self.metrics["tasks"], 1)
return {
"avg_tokens": self.metrics["tokens"] // tasks,
"delegated_ratio": self.metrics["delegated"] / tasks,
}
if __name__ == "__main__":
fake_model = type("M", (), {
"generate": lambda self, t, ctx: "ok",
"plan": lambda self, t: ["a", "b"],
"reliability": lambda self: 0.88,
"spawn_subagent": lambda self, t: type("S", (), {"run": lambda s, ctx: "done"})(),
})()
harness = AgentHarness(fake_model)
print(harness.route("写一句 slogan"))
print(harness.route("拆解这份财报的分析步骤"))
print(harness.batch(["a", "b", "c"]))
print(harness.report())
这段代码虽然为了演示把模型换成了桩对象,但路由、裁剪、委派三条主路径的逻辑是真实可落地的。难度分级避免了"杀鸡用牛刀";上下文裁剪直接砍掉长任务里被反复搬运的冗余历史;委派门槛则把 harness leverage 的边界写进了代码——可靠性不达标就退回直接回答,绝不在弱模型上硬上委派。这三道闸合起来,就是那 41% 节省的工程映射。门槛写进代码挡住翻车。
把视线收回 X6 本身,它其实是这套理念被产品化的结果。WRITER 反复强调一个词:模型与 harness 是"共演化"的。X6 不是先有模型、再套一层 harness,而是在模型开发阶段就把"怎么和编排层配合"当成硬指标一起训。后训练的目标函数里,天然带着 harness 优化要考虑的上下文成本与委派友好度。这种耦合,是单纯买别人模型所做不到的。
共演化的含义很实在:当你既掌控模型又掌控编排,就能在开发模型时就把"省 token"和"好委派"当作能力来训练,而不是事后在黑盒外面想办法补救。WRITER CTO 那句"我无法控制实验室是否弃用他们的模型",说的正是这种掌控权带来的确定性。自有模型保证了 harness 优化的兼容性不被上游一次更新打断,这是组合拳里最隐秘也最值钱的一块。确定性是组合拳核心。
所以下一次你评估一个企业级 agent,建议把顺序调过来:先看它的 harness,再看它的模型。管道决定了账单的下限,大脑只决定上限。2026 下半年的竞争力指标,正在从"谁的模型更聪明"悄悄换成"谁把同样的活儿跑得更便宜、更稳、更可控"。WRITER 用 Palmyra X6 和那篇论文,把这一层从幕后推到了台前。编排层的战争,已经打响。


被折叠的 条评论
为什么被折叠?



