
Grok 4.6追平梯队威海钢绞线,智力接近OpenAI与Anthropic旗舰,编程收获先,API价钱却低。但长链条Agent任务重大不及,是短板。本文融会其时间打破、成本势与交易挑战,磋商大模子竞争从比智力转向比“次托付”的新时势。
马斯克想让Grok在本年年底前拍完部《奥德赛》。
这听起来像个典型的马斯克式Flag:用AI挑战诺兰、好莱坞和2.5亿好意思元制作预算。但简直巧得关爱的,并不是Grok能不成在五个月里生成几千个镜头,而是它是否照旧领有把项复杂任务从新作念到尾的智力。
Grok 4.6发布后,这个问题有了具体的谜底。
在新轮模子竞争中,它照旧挤进好意思国大模子的梯队:智力接近OpenAI和Anthropic的旗舰模子,编程收获致使在部分榜单先,API价钱却昭彰低。与此同期,它在长链条Agent任务上的短板依然存在——会连系问题、会搭框架、会快速启动,却还不够重大地放胆。
这恰好亦然脚下大模子竞争的缩影。
当智力差距缩小、Token越来越低廉,简直决定交易价值的,照旧不仅仅“模子有多聪敏”,还要看次任务能否重大完成,以及完成次到底要花若干钱。
关于年向AI参预上百亿好意思元本钱开支的马斯克来说,Grok也不成仅仅偶尔冲前次榜单。它须不息留在桌,并把算力、数据和分发简直变成收入。
01.Grok 4.6上了桌,但还拍不了《奥德赛》诺兰的《奥德赛》上映前,马斯克照旧骂了这部电影好几轮。骂选角,骂改编,骂诺兰为了奥斯卡“亵渎荷马”。电影上映后,他干脆在X上立了个Flag,本年年底前,Grok Imagine要作念出部“符历史、忠于荷马艺术”的圆善《奥德赛》。
马斯克转发的三分钟《奥德赛》短片确乎可以。盔甲、海岸、东说念主物特写王人有电影预报片的质感,但三分钟精修短片和九十分钟长片之间,还隔着几千个镜头,以及群AI演员。
趁着Grok 4.6发布,咱们莫得再测试,而是给它出了两说念适谈话模子的题。说念,看它能不成读懂荷马。二说念,看它能不成搭出套把三分钟样片扩展成九十分钟长片的制片系统。
题,Grok答得比马斯克本东说念主靠谱。
“符历史”和“忠于荷马”听起来不难,真打开《奥德赛》就会发现,这两个维度很难同期罢了。《奥德赛》流程数百年口述传播,青铜时间的兵器、铁器时间的习俗和诗东说念主的传闻想象全叠在起。你可以考据奥德修斯该用什么剑、坐什么船,却没法从古迹里挖出眼巨东说念主、女神和冥界。
Grok把问题拆成了四层,青铜时间考古、荷马史诗里的混时期层、作品本人的诗学,以及诺兰的当代改编。
它给出的想法是,考古雅致敛迹器物、服装和地舆,荷马雅致敛迹东说念主物、叙事和诗学。它还顺遂修订了个流传很广的作假,「让千艘军舰起航的形貌」出自马洛,不是荷马。
这题讲明Grok 4.6不仅会查云尔,还能辨别个里面冲突的命题,替争议双构造强论证。
二题接近简直的制片使命。
Grok搭了个《奥德赛》制片遐想器威海钢绞线,把成片晌长、平均镜头长度、轮可用率、复杂镜头占比、并发任务数、东说念主工审核时期、成本和工期一起作念成可调参数。
Grok4.6生成的电影制片系统
按照默许参数,它估算部90分钟长片需要约208个使命日。Grok我方算完王人以为有点悬,后给出了条“识时务”的提议:作念部12到20分钟的荷马选篇。
天然,208天不成行动实测后果。轮可用率、连气儿失败率、每个可用镜头需要生成几次,王人是模子设定的假定。遐想器解释Grok会拆解工程、开采公式和搭建分娩系统,莫得解释这套系统真的能在208天内交片。
并且,它点出了AI电影难的部分。现时生成个漂亮镜头照旧不少见。难的是让几千个镜头中的脸、穿着、船只、空间和叙事保持致,同期把废片、重作念和东说念主工审核压到制片能承受的范围。
外部榜单给出的论断差未几。
在Artificial Analysis的榜单上,Grok 4.6的综智能指数是61分,与GPT-5.6 Sol同分,距离Claude Fable 5惟一1分。CursorBench 3.2上,Grok 4.6 High拿到69.9,过Sol的67.2。它完成次任务的成本约2.34好意思元,Sol约5.69好意思元。Grok 4.6的API的起价在每百万输入Token 2好意思元、输出6好意思元——价钱确乎有伤力。
图源 / SpaceX
但到了DeepSWE和TerminalBench这类长链条任务,Grok分手拿到65.9和26。Sol是73和34.6,Fable 5是70和34.1。
Grok照旧很会连系问题、启动形势和搭建框架,到了需要连气儿扩张、处分不测和重大放胆的阶段,仍然会掉链子。
综来看,Grok 4.6照旧坐上好意思国大模子的桌,并且在OpenAI和Anthropic旗舰模子眼前,出了张很凶的价比。
它会读荷马,会写分镜,会算工期,也会搭制片系统。仅仅奥德修斯漂了十年才回到伊萨卡,想让Grok在年底前带着几千个连气儿镜头告成“返乡”,现时看还很难。
02.35天代,马斯克先要确保Grok别掉队从7月8日Grok 4.5启动对外送,到8月12日Grok 4.6发布,中间只隔了35天。马斯克还预报,领有2.1万亿参数的Grok 4.7将在几周后到来,智力强,Token率,仅仅理稍慢。
4.7还没发布,参数和智力也惟一马斯克的说法,但4.5到4.6至少完成了次有的月度升。如果4.7如期落地,SpaceXAI就解析出我方粗略停留在梯队的智力。
这件事放在两年前,还有点难以想象。
2023年11月,Grok-1发布时,OpenAI照旧拿出GPT-4,Anthropic照旧发布Claude,Google背后则有TPU、搜索和云。那时候,Grok像X Premium附赠的聊天机器东说念主,企业客户、开采者生态和模子透明度王人没开采起来,B端的市集占有率也很低。本年4月,在Ramp客户的企业付费样本里,xAI的收受率惟一1.9,而Anthropic和OpenAI的这数字分手是34.4和32.3。
在许多从业者的眼中,和Meta样,SpaceXAI的大模子也历久困于二梯队。
但现时Grok端着凳子挤过来了。它能追上来威海钢绞线,主如果恣意极端迹,靠算力、数据和工程速率起硬堆。
xAI用122天建成了期10万张Hopper GPU的Colossus,随后又用92天扩到20万张。干事器到场19天后,钢绞线厂家集群照旧启动跑检修任务。黄仁勋把这段部署速率称为“东说念主”。X给Grok提供及时信息、用户和分发进口。Cursor则提供简直的编程任务和开采者与Agent的交互数据。Cursor称,Grok 4.5的检修使用了数万亿Token的Cursor数据。
模子也不每个月从新练遍。Grok 4.6开采在4.5的基础上,主要升监督微调、强化学习和Agent检修环境。Colossus雅致把检修限制堆上去,X和Cursor雅致束缚喂回简直任务,SpaceXAI再用后检修把这些任务压进下版模子。
这套活水线跑顺以后,版块号就能按月往前拱。
Grok也须跑这样快,因为SpaceX照旧把太多钱押在AI上了。
SpaceX招股书解析,2025年AI分部收入32亿好意思元,筹谋亏蚀64亿好意思元,本钱开支127亿好意思元,占公司总本钱开支约61。2026年季度,SpaceX又向AI分部参预77亿好意思元,占全公司本钱开支的76。到了2026年二季度,AI分部本钱开支杰出升至158.28亿好意思元,占三大分部本钱开支的约86,单季已流程2025年全年;上半年累计达到236亿好意思元。
SpaceX给投资者讲的故事照旧很明确。公司把AI和Space、Connectivity并排为三伟业务分部,并把AI称为畴昔垂直整的基础平台。在SpaceX我方测算的28.5万亿好意思元可量化市鸠集,AI占26.5万亿好意思元,火箭和卫星蚁合业务加起来惟一约2万亿好意思元。马斯克瞻望AI收入可能在2026年9月过SpaceX其他业务收入之和,四五年后,AI可能孝顺SpaceX 99的公司价值。
Grok是这笔重参预能否获赢得报的要津变量。AI分部可以顺利把算力给三,但惟一自有模子重大留在梯队,SpaceX才有契机把同套基础步调进取延长到API、订阅和Agent等附加值的业务。
如果Grok保持梯队,SpaceX可以同期赚模子、运用和算力的钱,还能用我方的模子给Colossus乃至畴昔的轨说念算力制造需求。如果Grok掉队,Colossus照样可以把GPU租给Anthropic和Google,但SpaceX会从全栈AI公司归还成重钞票算力房主,雅致建机房、买芯片和交电费。
并且236亿好意思元本钱开支,如果后只检修出个二流模子,这个故事只怕马斯克我方王人不好意念念讲。
03.从比Token单价,到比“次托付”昔日几个月,大模子竞争号称惨烈。
Anthropic依靠Claude Code和Fable 5在编程场景开采势,OpenAI随后用Codex和新模子追逐,Grok又在个多月内连气儿新两代。
榜单前排的保鲜期,照旧从几个月镌汰到几周。当头部模子之间的智力差距只剩几个百分点,另个数字就会变得格外显眼——价钱。
来自的模子,把这种压力杰出往前。
7月,月之暗面发布领有2.8万亿参数和100万Token潦倒文的Kimi K3。它的价钱虽不算低廉,但洞开权重本人就在放松头部模子厂商对理价钱的适度力。
DeepSeek走得。礼貌8月13日,DeepSeek V4 Flash每百万输入和输出Token的价钱分手惟一0.14好意思元和0.28好意思元。在DeepSeek公布的后果中,它的奢睿力照旧接近V4 Pro,浮浅Agent任务也能作念到附进水平。今日,DeepSeek天然晓示从北京时期8月17日0点起改用峰谷订价,但即便按峰价遐想,仍昭彰低于Grok 4.6的2好意思元和6好意思元。
OpenAI也启动再行算这笔账。
7月30日,在GPT-5.6发布仅三周后,OpenAI将Luna价钱下调80,Terra下调20。现时,Luna每百万输入和输出Token分手为0.2好意思元和1.2好意思元,Terra则为2好意思元和12好意思元。
OpenAI的法畸形清爽:Sol处分复杂的判断和规划,Terra承担平素使命,Luna推众多批范围清爽、重迭度的任务。它争夺的是通过模子单干,把整条使命流的平均成本压下来。
图源 / Artificial Analysis
大模子竞争由此进入了套复杂的计分规矩。
模子智力决定能不成上桌,长任务可靠决定客户敢不敢把活交给你,单元任务成本决定客户粗略用若干次。再往后,还要相比算力、分发、企业客户,以及不息钱的耐力。
Token单价仅仅其中容易看到的数字。
个模子即使每百万Token低廉半,如果扩张任务需要多智力、频劳苦试,或者老是在后20失败,省俭下来的理用度很快就会被返工和东说念主工审核吃掉。客户简直购买的,其实是次收效托付。
这亦然为什么Grok 4.6脚下值得关爱的规划,并不仅仅2好意思元输入、6好意思元输出。如果它能以低成本完成一样的任务,它即是低廉的模子;但如果它在TerminalBench这类长任务里容易失败,那么“低廉”就可能仅仅停留在价目表上。
拿这把尺子再看硅谷,各手里的并不相易。
Anthropic捏着Claude Code、长任务智力和企业客户信任,但它须束缚解释,这些势值得的价钱。OpenAI领有ChatGPT、Codex和隐敝不同价位的模子矩阵,可以在智力、速率和价钱之间纯真调兵。Google手里则有TPU、Google Cloud、搜索、Workspace和Android,可能是通盘玩中基础步和洽分发圆善的。Meta走的是另条路,通过洞开权重和酬酢平台分发,束缚压低通用模子智力的稀缺,仅仅若何把这种影响力简直滚动成收入,长期是另说念题。
SpaceXAI的特殊之处在于,它莫得哪张对先,但几张照旧启动彼此喂养。Colossus提供算力,X提供及时信息、用户和分发,Cursor提供简直编程任务、器具调用轨迹和开采者响应,Grok再把这些资源滚动成API、订阅和Agent居品。模子进入X和Cursor之后产生的新响应,又可以连续回到下轮后检修。
跟着Grok再行挤进桌,黄仁勋2025年的段评价也被再行翻了出来。他那时认为,马斯克同期押注基础模子、自动驾驶和东说念主形机器东说念主,进入了AI进攻的三个向,并因为掌捏大批简直全国数据而处在“佳位置”。这个判断现时容易连系了。
但领有河山,不等于照旧造成闭环。
特斯拉仍然是立公司。自动驾驶、机器东说念主、X和Grok之间究竟粗略分享若干数据、模子和客户,还受到组织范围、隐讳与监管的敛迹。SpaceXAI也莫得Google Cloud、Microsoft Azure或者企业办公软件那样熟习的销售和托付渠说念。
践诺的问题是,Grok在TerminalBench等长链条Agent测试中仍然落伍。企业客户关于安全、重大、透明度以及风险的费神,也莫得因为次榜单高潮就自动隐匿。
从“有价比的梯队模子”到“大的交易赢”之间,仍然隔着可靠、企业信任、渠说念和简直收受率。
就像马斯克想让Grok拍完《奥德赛》样,生成短片照旧不是难的事。简直难的是,别在返乡路上翻船。
作家 | 陈丹 裁剪 | 魏佳
本文由东说念主东说念主王人是居品司理作家【定焦One】,微信公众号:【AIX财经社】,原创/授权 发布于东说念主东说念主王人是居品司理,未经许可,辞让转载。手机号码:13302071130相关词条:玻璃棉 塑料挤出机厂家 钢绞线 管道保温 PVC管道管件粘结胶
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。