您现在的位置:kastop>> Kas信息 Web3信息>>正文内容

模型主权、Token经济学与区块链机遇

作者:Jinming,HashKey Capital;来源:Medium;编译:Shaw,金色财经

2oTIFMU83BS2BYpkMgzUZ4MqwrvWNQwWyXHHNb94.jpeg

摘要

当前所有使用大语言模型的机构都面临两大压力:模型主权风险与 Token 调用成本。

各国政府正逐步将前沿人工智能视作国家战略资产,无论是支撑模型运行的高端芯片,还是模型本身。近期典型案例包括:美国商务部出台出口管制指令后,Anthropic 的 Fable 与 Mythos 模型遭到使用限制。OpenAI 的 GPT-5.6 在面向大众开放前,也仅对小范围群体提供访问权限。尽管 Fable 5 的访问权限现已恢复,但当人工智能受制于政治议程与国家战略考量时,购买 AI 订阅服务不再意味着能够稳定使用前沿模型。除此之外,Fable 5 内置分类器,凡是被标记涉及生物、化学、模型蒸馏、网络安全相关的请求,都会被调度至性能更低的 Opus 4.8 模型处理。上述两种情况,都并非客户存在违规行为导致;这充分说明,服务商可以单方面限制甚至关停模型服务。以往仅依赖单一模型供应商的企业,必须评估自身的依赖风险 —— 最高性能模型的访问权限可能被骤然撤销。

随着人工智能使用规模呈指数级扩张,企业成本压力持续攀升。据报道,Uber 在短短四个月内耗尽了 2026 年度全部 AI 代码工具预算,随后出台管控政策,限制每位员工单款工具每月最高支出 1500 美元。特斯拉、亚马逊、Meta 等多家企业也采取了类似措施。设置使用上限、分配团队预算、审计资源消耗,如今已经成为通用做法,企业借此遏制不合理账单,同时对照实际业务产出核算 AI 投入效益。

多重不利因素交织,为依托透明化、无许可访问、抗审查、用户自主掌控理念搭建的 Web3 人工智能企业创造重大机遇。去中心化区块链基础设施能够强化模型所有权、保护数据隐私、降低对中心化中介机构的依赖,同时提升 AI 系统的韧性与可验证性。Nous Research 开源 Hermes 模型在模型层印证了这一思路;Venice AI 与 NEAR AI 达成集成,在推理层面实现隐私保护、匿名访问与可验证性;去中心化算力市场则将这套理念延伸至底层基础设施层。

1. 模型主权叙事

2026 年 6 月,依据美国国家安全出口管制指令,Anthropic 被要求暂停所有用户访问 Claude Fable 5 和 Claude Mythos 5;大约三周后相关指令解除,访问权限才得以恢复。无论人们如何看待背后的政策分歧,客观运营事实十分明确:一纸指令就能在数小时内让一款面向全球开放的 AI 产品全面下线,受影响的客户没有申诉渠道,也无法绕开限制继续使用。

这类风险敞口促使各国政府与企业推进主权 AI 项目:由国家支持搭建算力集群、本土训练模型、强制敏感业务部署在国内基础设施上,核心目的就是避免受制于境外服务商 —— 对方可能迫于本国政府要求切断服务。

2. Token经济学与企业预算危机

2025 年,企业生成式人工智能支出规模大约增至三倍,预估达到 370 亿美元,尽管单 Token 调用价格大幅下滑。这是典型的杰文斯悖论:单位成本下降催生海量新增使用需求,最终推动总支出持续走高。面向信息技术负责人的调研显示,绝大多数 AI 项目实际成本超出最初预算,相当一部分项目超支幅度超过 50%。AI 智能体(AI Agent)是成本飙升的核心推手:单个智能体完成一项任务可能发起数十次乃至上百次模型调用,随着智能体普及,企业成本持续累积。

前沿闭源模型的调用成本高于主流开源模型

UKcz0ejj24uPbO7BRQDFO23WaLxKmYTXDs0EU5Hl.jpeg

主流模型每项任务的 Token 消耗量

e2bMw3g5wNHDrzNZQeDCA4V4XufWnEb0y0wxW4pI.jpeg

Uber 是迄今为止最典型的案例。受智能体调用 Claude Code 与 Cursor 工具影响,该公司仅用四个月就耗尽了 2026 年度全部 AI 代码工具预算。随后 Uber 出台管控措施,限定每位员工单款工具每月最高支出 1500 美元,并搭建数据看板监控资源消耗。特斯拉、亚马逊、Meta 等企业也采取了类似方案。另有消息称,微软取消了大部分内部 Claude Code 授权,引导员工转向 GitHub Copilot 命令行工具。随着开源模型的智能水平逐步追平前沿闭源模型,企业 AI 策略已经发生转变:不再单纯追求调用顶尖闭源模型,而是采用混合部署方案,最大化 Token 成本效益。

企业如今正在搭建AI FinOps职能体系(用量计量、人均成本看板),并采用分层模型组合策略:选用低成本、高效率模型处理信息提取与常规任务,前沿推理模型仅留给复杂推理场景使用。

开源模型 GLM-5.2、Kimi K3 综合能力跻身全球前十

nMLMme0Ew8mqYrMgZZbR5AQyV7mwscI7vvUoXNWA.jpeg

3. 全新核心能力:模型选型与Token策略

模型主权风险与 Token 调用成本共同指向同一个运营结论:不要完全依赖单一服务商。原生 AI 法律平台 Harvey 与 Fireworks AI 展开合作,依托 Harvey 法律智能体基准测试一套混合 AI 方案。平台将开源权重模型 GLM-5.1 作为主力执行模型,仅在确有增益的子任务中调用 Claude Opus 4.7 充当可按需启用的顾问模型,平均每项任务仅调用 0.83 次。

测试结果优于单一前沿模型部署方案:混合架构下,100 项任务中有 18 项完全达标;而全程单独使用 Opus 仅完成 14 项。同时总推理成本为 368 美元,对比单独运行 Opus 的 954 美元大幅下降。

11D5QyOIGA6es0Mwx5eLTJsvCJ6M3grRDaCM9R9d.jpeg

OpenRouter 针对其新推出的 Fusion 功能开展的一项研究同样表明,混合模型方案的表现能够超越单一前沿模型。

3kt0ki4oTYAqXnNNM7tYl9kCIGGcqFrrU6ekJ7jT.jpeg

市场对具备弹性的混合模型方案的需求,已经催生出一套独立技术领域 ——大模型路由(LLM routing),或称模型编排,配套工具生态也逐步成型。根据任务匹配最合适的模型、掌握模型所有权,正成为 AI 驱动型企业的核心优先事项。

4. 开源模型与区块链基础设施蕴藏的机遇

依赖闭源专有模型会形成单点故障风险,而开源模型能够消除这一隐患。企业一旦可以下载模型权重,就不再受制于服务商的出口许可、API 突然停用、调价行为,或是一夜之间收回访问权限的政策变动。企业能够在自主掌控、自选辖区内的基础设施上运行模型,成本主要来自算力开销。如今开源模型的迭代速度与性能水平,已经足以支撑这套逻辑,不再只是备选方案。根据人工智能分析机构(Artificial Analysis)的智能榜单,智谱 AI 的 GLM-5.2 成为首款跻身榜单综合得分前十的开源权重模型;月之暗面的 Kimi K3(模型权重计划于本月晚些时候发布)当前评测分数更高,性能比肩 Opus 4.8。开源权重模型不再只是 “性价比选择”;对于愿意自建部署的团队而言,在智能水平相近的前提下,它越来越成为保障模型主权的稳妥方案。

开源权重模型允许企业自主部署,降低了对专有 API 的依赖,但无法摆脱对芯片、数据中心与云服务商的需求。区块链恰好可以化解这类瓶颈:协调并实现无许可算力供给、可编程支付,同时生成不可篡改、可核验的记录。

下文我们将举例说明,企业如何借助区块链基础设施降低 AI 全产业链依赖,搭建具备韧性的 AI 运营方案。

破解算力瓶颈的加密方案

Aethir、io.net、Akash 等去中心化算力网络借助Token激励,调度大量独立 GPU 运营方与数据中心资源;由智能合约完成资金结算;不存在掌握生杀大权、可封禁用户或特定地区的中心化平台,推动市场定价更具竞争力。io.net整合独立数据中心、加密矿工及其他供应商手中分散的 GPU 资源,搭建按需调用的训练集群:平台实时监控资源可用状态,依据硬件规格、地理位置、网络连通性匹配 GPU;通过 Docker 标准化软件环境;依托基于 Ray 的调度系统搭配安全网状网络,优化负载分配、降低冗余风险、协同分布式训练。Wondera 利用io.net分布式算力训练三款自研音乐 AI 模型,成本降低 66.7%。项目耗费 55.2 万余 GPU 小时,总投入 124 万美元;同等算力在传统云平台通常需要 372 万美元。

对于参数规模约 10 亿~300 亿的模型而言,一小批企业级 GPU 集群通常足以完成开源权重模型的微调。因此,去中心化算力网络的核心价值目标,并非打造性能最强的前沿大模型 —— 这一愿景目前仍难以实现;而是产出能够满足业务场景需求的模型,同时规避算力获取受限、长期合约锁仓、高昂算力资费等风险。

依托加密技术解决模型数据、访问权限与隐私难题

当下主流大模型服务商,在面向付费个人用户的套餐中,默认收集用户提示词、上传文件与对话记录,并利用这些数据对模型进行迭代优化,除非用户主动选择退出数据采集。当企业员工通过这类面向个人的接口开展工作时,自研代码、金融模型、客户数据有可能流入服务商的训练流程,存在商业机密泄露风险,而这家服务商未来甚至可能转变为竞争对手。

企业版与 API 服务通常会通过合同约定,不将客户数据用于模型训练,但这类保障取决于套餐选择、配置设置,还需要防范影子 IT行为。2023 年三星源代码泄露事件,直观暴露了这套模式存在的漏洞。因此,去中心化 AI 更有力的支撑逻辑,不只是阻止数据被用于模型训练,而是用技术可验证机制替代单纯的合同承诺。加密技术与可信执行环境(TEE)能够在数据处理阶段保护隐私;零知识证明可以对计算执行过程进行核验;区块链则能够记录各类可信证明,并协调多方独立运营节点。

在推理层,Venice AI 等项目提供具备多层隐私等级的模型访问通道。当用户调用匿名模型时,请求会先经由 Venice 代理通过加密通道转发,Venice 不会存储用户数据,用户身份信息也不会发送给模型服务商。平台同时支持加密钱包支付,绕开传统银行交易日志,进一步保护用户身份。针对私有模型发起的请求,则会经过零数据留存基础设施路由。可信执行环境(TEE)、端到端加密(E2EE)等附加隐私技术筑牢防护屏障,防止未授权第三方留存数据。

Venice AI 同时承担模型路由功能,用户通过单一 API 即可调用多款模型,大幅降低对单一服务商的依赖风险。截至目前,该平台支持 200 余款 AI 模型,依托 300 万以上活跃用户,年化营收规模突破 7000 万美元。

NEAR、io.net、OpenGradient 等其他平台同样提供保护用户数据隐私的机密计算服务。OpenGradient 采用混合 AI 计算架构(HACA),将模型计算与计算验证流程相互解耦。用户可以选择多种可信方案,包括可信执行环境(TEE)与零知识机器学习(ZKML);相关验证由链上验证节点执行,验证结果存储于 Walrus 等去中心化存储平台。NEAR 同样借助 TEE,在模型训练与推理阶段隔离敏感数据与模型权重。密码学可信证明能够证实:经授权的代码在安全隔离区内运行,并且输出结果由该可信环境签名。

在模型训练层,Nous Research 推出 Hermes 系列开源权重模型,企业可自行部署或在自有基础设施上微调,完全无需将涉密数据发送至第三方 API。为构建具备抗风险能力、不受单点算力故障影响的训练体系,Nous Research 开发了基于 DisTrO 与 DeMo 框架的去中心化训练基础设施 Psyche。Psyche 网络依托通信高效的 DisTrO 优化器、基于 Solana 的调度协调机制,实现分布式训练。

基于 DeMo 框架开展的 3 亿、10 亿参数模型实验证明:在模型精度相当的前提下,通信开销最多可降低 85 倍。Solana 在每一轮训练过程中维护全局共享状态,分布式参与节点可以同步信息、核验各方贡献,无需依赖中心化链外调度器。在这套架构中,分布式优化算法降低通信需求,区块链负责完成节点协调、计算核验、资金结算与激励发放。

通信开销优化

此处 “每步传输数据量(MB/step)” 指标下降意味着:DeMo 传输完整梯度更新包所需网络带宽更低,普通互联网连接即可支撑模型训练,不必依赖昂贵的高速互联网络。

MFQZl24u1wizrDJM2rlFcxyEzPMHhKIDQFuf5P8D.jpeg

模型质量

eSwy99dgp9jr7yOiWIpdgCxo3tHOM2iIK1sEKA9r.jpeg

局限性与展望

现阶段,去中心化算力网络仍然无法训练前沿大模型;同时可信执行环境(TEE)、零知识机器学习(ZKML)等验证技术会带来延迟与额外成本开销,未必适配高吞吐推理场景。当前业界顶尖(SOTA)模型普遍采用混合专家架构(MoE),这类架构对低延迟、高带宽有着硬性要求;依托公网、采用 DeMo、DiLoCo 等压缩技术的分布式训练算力方案,暂时无法解决这一瓶颈。

即便存在上述约束,企业 AI 战略未来也很难采用 “一刀切” 的统一方案。地缘冲突加剧、整体推理成本持续攀升,让高度依赖少数中心化闭源模型服务商的风险持续暴露。开源、私有化、面向特定任务的中小型本地模型有望加速普及,这将为加密基础设施创造全新机遇。加密基础设施能够实现算力的去中心化访问、可验证且保护隐私的模型推理,以及可编程协同调度,从而助力企业更好掌握部署自主权、管控成本、保障数据所有权。



感动 同情 无聊 愤怒 搞笑 难过 高兴 路过
【字体: 】【收藏】【打印文章】 【 打赏 】 【查看评论

相关文章

    没有相关内容