值得信赖的区块链资讯!
Meta开启低价竞争,小扎对谷歌贴脸开大
作者:ASI启示录 新智元
太卷了。
九月才过去3天,就已经有五个前沿模型发布了!
Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。
就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。
小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的*飞跃!

Meta 超级智能实验室的掌舵人 Alexandr Wang也连发三条X,揭秘了这次「王炸」的核心杀手锏。
他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。

Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。
跑分显示,这次 Muse Spark 1.3 的提升更大。
它不仅在跑分上反超了GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前*梯队。

在五个月里,Meta已经不知不觉迭代了4个Muse Spark版本了。
亚历山大王嘲讽谷歌
「吸别家模型尾气」
最近,AI*梯队可是非常拥挤。GPT-5.6把持着王座,Fable 5.1后来居上,Gemini 3.8 Flash正弯道超车。
Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。
在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。
Muse Spark 1.3:75.4 分
Claude Opus 5:74.0 分
GPT-5.6 Sol:73.0 分

不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。
在SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。
在Terminal-Bench 2.1它拿下88.8 分。
在MRCR 512K-1M上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。

在 Agent能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与Opus 5仅剩几个百分点的微弱差距。

在Artificial Analysis上,Muse Spark 1.3把Gemini 3.8 Flash明显甩在身后。
在智能指数上,它获得了62分,与Claude Fable 5持平,跻身*行列。

而在最受开发者关注的成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。
面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」
谷歌真是虎落平阳。

有人戏称:「谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」

Less is More:1美元跑2小时的性能怪兽
跑分高固然厉害,但在如今的AI圈,真正让开发者兴奋的,永远是好用且便宜。
Muse Spark 1.3 之所以被称为性价比*,是因为它不仅跑得快,还特别会省钱。
正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。


它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。
针对长周期编程和更优的指令遵循能力,Muse Spark 1.3进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。
它变得更聪明利落,代码风格更干净,废话更少。
而这种减法带来的直接后果,就是成本的断崖式下跌。
下面就是一个非常震撼的真实实测案例。
开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与Fable 5.1 xHigh 进行了对比。

他给出的 Prompt中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。
这两个模型都运行了大约 2 个小时,结果惊人。
Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。
而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元!
这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」
在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。

在定价上,Muse Spark 1.3的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进Meta的产品。)

Codedamn创始人、开发者Mehul Mohan直呼:
Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「DeepSeek 定价时刻」。

在 Artificial Analysis 的统计中,在同等智力水平(得分59以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55美元,是*的*解。
作为对比,同等智力(61分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。
甚至,开发者 Kartik指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。
它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的token效率高得惊人。

Alexandr Wang的狂飙,小扎的*野心
Muse Spark 1.3 的横空出世,离不开其背后的操盘手。
今年 7 月,Meta发布 Muse Spark 1.1,主打 的是1M 超长上下文和计算机操作。
短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。
如此快速的迭代,正是Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。
他们的*目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。
也就是说,Meta看下一个ASI风口——「智能体工程」。
Meta AI负责人Alexandr Wang在接受Axios采访时明确表示,所有的可用性改进,都是为了服务小扎多次提及的宏伟蓝图——打造 7×24 小时在线的个人智能体。

要想让一个智能体 24 小时帮你处理邮件、写代码、分析数据,它必须具备两个条件。
1.极度聪明且稳定:它需要撑住极长的对话线程(长线程),能够并行处理多个工作流。
当指令模糊时,它要懂得主动提问;当遇到阻碍时,它要懂得向人类求助;在执行关键操作前,它要懂得确认。最重要的是,不产生幻觉。
2.极度便宜:如果个人智能体运行一天的成本高达几十美元,那它永远只能是少数人的玩具。
Muse Spark 1.3 的出现,本质上就是为 7×24 小时个人智能体铺路。
它就像一个成熟的资深工程师,你给一个目标,它就能自己规划、自己纠错、自己交付。
为此,北大校友、Meta研究员孙之清透露Meta团队对此前的牛油果avocado模型再次后训练,实现了更好的测试scaling。

狂欢背后:我们被「刷榜」骗了吗?
不过,Muse Spark 1.3也同样受到了质疑。
知名 AI 机构 BridgeMind发了一段引人深思的话:
Gemini 3.8 Flash 和 Muse Spark 1.3 今天同时发布。两者在基准测试上看起来都很出色。
Muse Spark 1.3 目前在智能指数上与 Fable 5 并列……我想感到兴奋。但我没有。
因为,这个月的AI发布如出一辙,分数飙升,但真实世界的体验却毫无长进。
这令人沮丧。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,我的信任更是所剩无几。

这段话,精准地击中了当前大模型行业的痛点。
有网友对Muse Spark 1.3、Gemini Flash 3.8z在后端级3D约束下做了压力测试,结果两个模型的老底都被揭穿了:
Muse Spark 1.4并没有那么好,而Gemini Flash 3.5纯纯在刷榜。

现在,各大实验室已陷入「为了跑分而训练」的怪圈。一个模型发布,必定伴随着几张吊打友商的雷达图和排行榜截图。
DeepSWE、Tau3-Bench、GPQA,成了各家疯狂「刷题」的目标。
而Muse Spark 1.3 也露出了马脚。
在 Artificial Analysis 的深度报告中,我们也能看到它的一丝退步。
比如,在 AA-Omniscience测试中,xhigh 和 max 版本都有所下降。原因是它的「弃权率」变高了——当它不确定时,它更倾向于不回答,而不是胡编乱造。
这降低了幻觉率,但也侧面说明,它的*知识储备并没有像跑分提升得那么夸张。
大模型的下半场,到底比什么?
今天 Muse Spark 1.3和Gemini 3.8 Flash的发布,可以让我们得出以下几个判断。
首先,基座模型的「参数红利」正在见顶。
单纯靠扩大参数规模来提升智力的路径,边际效益已经越来越低。
未来,谁能像 Muse Spark 1.3 一样,在系统架构上引入类似「循环深度」的推理机制,在工具调用上做*的「减法」,谁就能获得真正的体验跃升。
另外,「智能体工程」才是胜负手。
大模型之争,已经从「谁更会说话」转向「谁更能干活」。
未来的核心壁垒不是单一跑分,而是在极低成本下,长程任务的真实落地能力。
像 Muse Spark 1.3 这样,用不到 1 美元跑完 60 次试错循环的模型,将彻底重塑商业模式。
Twitter:https://twitter.com/BitpushNewsCN
比推 TG 交流群:https://t.me/BitPushCommunity
比推 TG 订阅: https://t.me/bitpush
比推快讯
更多 >>- LAPTOP 合约拆解:约 132 天前已部署,总量 10 亿枚 80%集中于同一组多签
- Kalshi 比特币永续合约获力挺,美 CFTC 称 CME 诉讼“无事生非”
- 拜登 Meme 币 LAPTOP 公布详细代币经济学
- 当前市场认为共和党将在中期选举大获全胜的概率低至 11%
- 拜登之子 Meme 币 LAPTOP 提醒社区警惕假冒代币和恶意链接
- Harmony 提议关闭区块链,将 ONE 代币迁移至以太坊
- LAPTOP 各链同名 Meme 币炒作先行,多数走势为先冲高后归零
- 约 3400 枚 BTC 已返还 Liquid,仍有约 600 枚未追回
- 拜登 Meme 币给市场泼冷水降温,投资者或担忧重蹈 TRUMP 覆辙
- Galaxy Research:比特币昨日交易笔数达历史第四高
- Arkham 标记 Wintermute 持有 240 万美元 PONS 仓位
- 拜登主题 Meme 币普涨,BODEN 市值短时突破 170 万美元
- 亨特·拜登 X 账号关注 Meme 币 Laptop 相关账号
- 美前总统拜登之子 Hunter Biden 发推确认,预热 LAPTOP 发布
- Bitfinex :比特币矿工持仓指数为 -1.2,表明矿工抛售意愿不高
- 波兰检方对 Zondacrypto 案第五名嫌疑人提起指控
- CZ 澄清 X 账号未被盗:取关一批 30 天以上的非活跃账号
- 加密圈热议政治 Meme 币再起,社群风向多以讽刺和风险提醒为主
- 疑似拜登之子新 Meme 币项目$LAPTOP官推账号及合约公布
- 以太坊基金会发布 Hegotá升级 62 项 EIP 评级,目标 2029 年底实现抗量子以太坊 L1
- 拜登之子 Hunter Biden 计划于本周推出笔记本电脑主题 Meme 币,进军加密市场
- 前美国总统拜登之子计划推出 Meme 币 LAPTOP
- BTC OG 内幕巨鲸以均价 86.3 美元抛售 11.4 万枚 HYPE,获利 157 万美元
- 数据:某地址连续 10 天每日买入 HYPE,累计 19.42 万枚,价值 1679 万美元
- 数据:Garrett Jin 出售 11.4 万枚 HYPE,获利 157 万美元
- 马云间接持股的云锋金融获纳入沪港通及深港通,曾披露买入 1 万枚 ETH
- 数据:BTC 跌破 79000 美元
- 比特币短时跌破 7.9 万美元
- BTC 跌破 79000 USDT,24H 跌幅 0.93%
- “1011 内幕巨鲸”代理人平仓 1.07 亿美元 BTC 多单
- 去中心化永续合约交易所 Antarctic Exchange 完成 700 万美元融资
- Trade.XYZ 官网悄然上线预测市场,当前涉及三个板块
- 今日美国比特币 ETF 净流入 2038 枚 BTC,以太坊 ETF 净流入 22023 枚 ETH
- 高盛大幅上调光模块市场预测:2028 年规模或近 1500 亿美元
- 以太坊将 Frame Transactions 列入 2027 年升级,用户无需持有 ETH 支付 Gas
- 数据:BTC 与黄金 90 日相关性升至 0.56 创 2017 年以来新高
- 阿联酋总统顾问:将构建替代能源路线,能源出口不会被美伊冲突绑架
- 伊朗经济部设立经济战争指挥部
- OpenAI Astra 发布再点燃 AI 算力热情,存储芯片成新主线
- Strive CEO 暗示将继续买入比特币,预计将购入超 1100 枚 BTC
- 某交易员 50 倍做多 BNB 与 ASTER,单笔最高回报近 590%
- 美股今日休市一日,金银油交易提前结束
- Robinhood Chain 过去 24 小时费用收入超 260 万美元,仅次于 Tether 和 Circle
- 受 BONK GUY 喊单影响,SOCK 市值突破 1300 万美元
- 美方制裁难堵伊朗资金:约 90 亿美元影子银行资金仍经美国银行流转
- 巨鲸 Loracle 继续加仓 PONS 空单,现持仓金额超 2100 万美元
- DBS 与花旗实现首笔周末美元跨境支付:代币化存款仅需数分钟到账
- glassnode:隐私赛道成年度最大赢家,ZEC 领涨带动板块市值升至 336 亿美元
- 受 Meme 代币 LUNA 影响,链上 LUNA 一度触及 2000 万美元
- 知乎拟出资 15 亿元参与设立 AI 基金
比推专栏
更多 >>观点
比推热门文章
- LAPTOP 合约拆解:约 132 天前已部署,总量 10 亿枚 80%集中于同一组多签
- Kalshi 比特币永续合约获力挺,美 CFTC 称 CME 诉讼“无事生非”
- 拜登 Meme 币 LAPTOP 公布详细代币经济学
- 当前市场认为共和党将在中期选举大获全胜的概率低至 11%
- 拜登之子 Meme 币 LAPTOP 提醒社区警惕假冒代币和恶意链接
- Harmony 提议关闭区块链,将 ONE 代币迁移至以太坊
- LAPTOP 各链同名 Meme 币炒作先行,多数走势为先冲高后归零
- 约 3400 枚 BTC 已返还 Liquid,仍有约 600 枚未追回
- 拜登 Meme 币给市场泼冷水降温,投资者或担忧重蹈 TRUMP 覆辙
- Galaxy Research:比特币昨日交易笔数达历史第四高
比推 APP


