主页 > 国内 >

海边的曼彻斯特

懂你、能交付、专业操作:金山办公田然给出AI办公助理的三项标准_我的网站

我的女友是九尾狐

一 |     过去几年,大模型越来越会写:能列提纲、做总结、改文案,也能生成一份看起来完整的PPT。但进入真实办公场景后,问题往往出现在下一步——它是否知道用户正在推进哪个项目,能否把任务真正做完,交出的表格、文档和PPT又能不能继续修改、核验和协作?          7月15日,在金山办公AI生产力大会现场,金山办公助理总裁田然发布灵犀专业版。    【文/观察者网专栏作者 唐晓甫】          7月19日,Kimi K3发布48小时后,月之暗面暂停了C端新用户订阅。虽然此前其他模型也曾出现疑似算力不足引发的“降智”现象,但是类似一款国产大模型因需求过载而主动限流,这在国内AI行业中实属罕见。他没有从模型参数讲起,而是先谈了一个更接近真实工作的角色:助理。这也恰恰说明Kimi K3作为一个开源模型,正对全行业商业化定价形成长期冲击。         Kimi时刻到了!          Kimi K3究竟有多火?看看使用量就知道了。根据全球规模最大、最受欢迎的AI模型API聚合与路由平台OpenRouter,截至北京时间7月22日上午,Kimi K3的过去7天(上线仅6天)的词元使用量就超过7400亿,在所有模型中排名第14(榜单实时更新)。         “参谋可以出主意,但助理要把事情做掉。         Kimi K3在Open Router上的实时调用情况 Open Router          而这种需求的背后是并不便宜的定价,作为一个拥有1.05M词元超长上下文长度的大模型,其API定价为每百万词元输入3美元、缓存命中输入0.3美元、输出15美元。”田然在现场说。         我们可以对比一下,DeepSeek-V4预览版已经采用峰谷定价:V4 Flash的输入、缓存命中和输出价格分别为0.14美元、0.0028美元和0.28美元;V4 Pro则分别为0.435美元、0.003625美元和0.87美元,显著低于Kimi K3。按照他的判断,一名优秀的AI办公助理需要具备三项能力:懂用户的上下文,高质量完成任务,具备专业的Office操作能力。

二 | 这三点也构成了灵犀专业版的产品主线。         智谱GLM-5.2的每百万词元普通输入、缓存命中输入和输出价格分别为1.4美元、0.26美元和4.4美元。         懂你的上下文:少让用户重复解释背景          一项办公任务很少从空白开始。         做行业分析,需要过去的数据表、会议材料和旧版报告;修改方案,要知道哪些意见已经确认、哪些内容已经删除;准备汇报,还要沿用用户长期形成的表达方式和数据偏好。K3的普通输入价格约为GLM-5.2的2.1倍,输出价格约为其3.4倍;两者缓存命中价较为接近,K3仅高约15%。可以说,粗略一看,无论从何种角度看,对于国人来说,Kimi K3都谈不上便宜(写作期间,Qwen 3.8尚未公布其API价格)。         虽然这一价格仍明显低于OpenAI和Anthropic的最高端模型,但对于很多国人来说已经偏贵。

三 | 事实上,从定价的角度看,Kimi K3与美国顶级大模型更加接近。         OpenAI的GPT-5.6 Sol每百万词元的短上下文输入、缓存命中和输出价格分别为5美元、0.5美元和30美元,长上下文则提高至10美元、1美元和45美元。我们可以看到,K3较GPT-5.6 Sol,普通输入和输出均便宜约40%至50%。

四 | 而更低一档的GPT-5.6 Terra定价为2.5美元、0.25美元和15美元,其输出价格与K3完全相同,输入和缓存价格还略低于K3。         Anthropic的最新高端模型Claude Fable 5的普通输入、缓存命中和输出价格分别为10美元、1美元和50美元,K3大约相当于其30%;Opus 4.8则为5美元、0.5美元和25美元,K3相当于其60%。         作为迄今为止全球参数规模最大的开源模型,Kimi从技术路线上就选择独创的混合线性注意力机制。当然这样的路线选择也注定K3在设计之初就没想依赖性价比取胜,而是希望通过更高的性能上限获得更高溢价。

五 |          如果AI只理解眼前的一句话,用户每次都要重新上传材料、交代背景,它更像一个临时问答工具,而不是能够长期合作的AI办公助理。         灵犀以“项目”为基本单位管理上下文,将此前的对话、输出文档、相关资料、技能和参与人员放在同一个空间中。而这种通过追求更高性能上限来获取高溢价的路线,几乎是中国开源模型的首次商业尝试,但这一次,它似乎正在成功。用户再次进入项目时,可以沿着此前的进度继续工作,不必重新说明项目背景和修改历史。

六 |          根据官方公布的相关数据,Kimi K3在编码、通用Agent和视觉Agent三大板块的所有子项目上排名都在前三之列,而且在部分子项目上处于世界第一的水平。根据相关程序员实测,虽然Kimi K3的词元利用率相较于GPT-5.6 Sol和Fable5偏低,部分压低了其相对于这两款顶级模型的成本优势,但其前端能力已经跻身全球第一梯队,部分场景甚至达到世界第一水平。         发布会演示中,用户只提出一句“完成新能源行业头部竞品数据分析”,灵犀便从知识库中寻找竞品数据追踪表和项目资料,再搜索互联网及第三方专业数据源,形成分析结果。

七 | 这是此前的开源模型从未达到过的成就。         Kimi官方给出的成绩单涵盖编码、通用Agent和视觉Agent三大板块,在所有排名中,Kimi K3在多数项目中进入前三,甚至部分小项排在第一 Kimi          国内外不少程序员第一时间就开始对Kimi K3进行尝试,通过类似乃至一致的prompt对比K3与GPT-5.6 Sol和Fable 5等AI大模型的前端生成能力。         随着使用深入,灵犀还会沉淀用户的写作风格、数据偏好、表达结构和项目经验,并定期整理这些信息。系统会在算力相对空闲时归纳当天产生的信息,更新个人知识库;在用户授权后,也可以从指定的本地文件夹中寻找新增资料。         这项能力的价值,不只是让AI记住更多信息,而是让用户少解释一次背景。真正懂工作,还要知道哪些材料属于当前项目、哪些版本仍然有效,以及任务接下来要往哪里推进。测试结果令人惊讶,不少程序员都反映,Kimi K3在3D效果生成、游戏生成、UI生成等场景都有非常好的表现,甚至可以在不少场景中击败GPT-5.6 Sol和Fable 5。         高质量交付:从给建议,到把事情做完          田然在演讲中区分了“参谋”和“助理”:参谋可以提出想法,助理则要把事情落地。

八 |          外网实测后对Kimi K3评价普遍不低 X          而这样的成绩,无疑让人们进一步思考一个问题:大模型真的像美国人说的那样,有那么高的壁垒吗?          大模型真的有那么高的壁垒吗?          如果说DeepSeek R1横空出世,第一次系统地向全球开发者展示了如何通过大规模强化学习,让模型在缺少人工标注推理轨迹的情况下形成长链推理、自我验证和反思能力,让世界上除了GPT以外的模型理解了如何构造适用于复杂任务的长思维链,降低了其他模型相对于GPT的技术代差,推动全球大模型在2025年进入了百花齐放的阶段。         那么,Kimi K3在编码、通用Agent和前端开发等测试中的良好表现,则进一步动摇了人们过去对于“闭源模型必然长期、显著领先于开源模型”的信念。         灵犀不仅生成内容,还可以调用文档、处理数据、打开浏览器、编写代码,把任务持续推进到最终结果。

九 | 它的出现以一种毫无疑问的方式,证明了开源模型与全球最强闭源模型之间的差距,已经从过去的代际差距缩短到1-3个月,甚至在部分具体任务上出现反超。         其实,如果长期关注人工智能发展最新动态的人,对于这个结果的出现绝对不会感到意外。         在团队协作中,用户可以把同事拉入同一个项目空间。         大模型开源始于已经在本轮顶级AI模型竞争中出局的Meta。不同成员围绕同一份材料提出意见,灵犀在统一上下文中依次处理,减少信息在群聊、个人AI和文件之间来回传递。

十 |          面对更复杂的需求,灵犀可以把数据分析进一步转化为在线系统,并执行本地指令完成部署。对于没有标准API接口的网页系统,也可以在用户授权和身份范围内调用浏览器,完成填写信息、上传附件和推进流程等操作。         这些能力将办公软件的边界从文档延伸到浏览器、本地环境和业务系统。2023年2月,Meta发布第一代LlaMA,主要向研究机构开放;同年7月推出Llama 2后,允许开发者将模型权重用于研究和商业应用,并开始建立当时全球规模最大的开源大模型生态。         Meta选择开源和本地部署的核心原因在于,其收入来自社交平台和广告,并不需要直接依靠出售模型调用获得回报。其核心思路就是通过降低基础模型的稀缺性,推动Llama成为行业公共底座,让竞争优势更多回到应用、用户入口、数据和产品分发,将商业模式拉回到自己最熟悉的环节。         但此后,包括Qwen在内的一批大模型厂商也进一步扩大了开源模型的供给,而且他们还叠加了更加现实的企业需求:用户可以将模型部署在自己的服务器上,允许开发者修改、部署和二次开发,降低敏感数据上传外部云端的风险,吸引云厂商、硬件企业、科研机构和应用开发者围绕Qwen建立生态,并减少对单一模型供应商的长期依赖。过去需要用户在多个软件之间反复切换、手动衔接的工作,如今可以交由AI办公助理推进。         只是这一系列尝试并未真正动摇以OpenAI和Anthropic为代表的闭源模型在前沿能力上的领先地位。         但高质量交付不能只看任务是否显示“已完成”,还要看结果是否准确、过程能否检查、用户是否仍需大量返工。

十一 | AI办公助理的价值,是接过重复、琐碎、耗时的环节,让人把精力留给判断、沟通和决策。2024年9月,OpenAI发布o1-preview,首次将测试时计算和长链推理能力系统性地应用于商业大模型。          该图片疑似使用了AI生成技术,请谨慎甄别          Office专业操作:交付可以继续使用的原生文件          对于AI办公助理来说,完成任务之后,还有一道现实门槛:交出来的是不是一份真正的办公文件。在数学竞赛、高难度科学问题和复杂代码推理等任务上,也一度拉开了与绝大多数模型的距离,进一步稳固了先发优势,也推动了所谓AI神话的出现。         当时国内不少人认为以ChatGPT为代表的美国闭源模型,已经完全取得了对于开源模型尤其是中国模型的绝对优势,直到DeepSeek R1的出现以及2025年初的“DeepSeek时刻”。

十二 |          一些AI生成的表格没有公式,用户无法核验数字是怎样算出来的;一些PPT看起来完整,打开后却是一张图片,或者由大量文本框拼成,难以继续修改。         田然在发布会上多次强调,灵犀要坚持原生Office操作。         DeepSeek R1作为开源模型,首次在数学、代码和通用推理等测试中整体接近o1正式版。

十三 | R1在AIME、MATH-500、LiveCodeBench和SWE-bench Verified等测试中与o1互有胜负,证明开源模型与最强闭源推理模型之间已经不再存在此前想象中的代际差距。

十四 |          虽然DeepSeek R1造成了美国股市的短暂暴跌,并且引领了全球顶级AI进入“推理AI”的时代,但从科技资本的角度来说,DeepSeek R1的出现并没有动摇美国AI投资神话。         在表格中,计算使用原始公式和表格指令,用户可以直接查看数据关系;图表使用标准控件生成,可以继续调整数据、维度和展示形式。原因是多样的:          1. DeepSeek R1虽然显著缩小了与o1的差距,但OpenAI于2025年4月正式发布o3之后,R1在复杂代码、科学推理、多模态理解和工具调用等方面的差距被重新拉大;          2. R1在AI幻觉率等多方面表现并不令人满意,在Coding和Agent能力方面与外国加速更新的顶级AI差距明显;          3.R1缺少多模态能力;          4. DeepSeek R1的出现甚至刺激了全球范围内对芯片的需求。

十五 | 在文档中,用户可以同时在对话栏、正文和审阅区与灵犀交互,AI既能修改正文,也能处理批注和修订记录。当时黄仁勋就表示,像DeepSeek代表的推理型AI模型,在面对复杂问题时需要进行“思考”,进行大量的强化学习、微调和模型蒸馏,由DeepSeek引发的全球模型推理潮会让新的模型比传统的非推理模型消耗的计算量高出约100倍。         以上种种原因,都推动了美国的科技股神话在2025—2026年进一步登上神坛,并且在许多普通人心中树立了一个闭源模型不可战胜的思维烙印。也正是这种烙印,推动了科技巨头进行AI基础设施创纪录的资本开支,以及迎来了AI Agent时代的到来。         事实上,仅就中美两国顶级模型的基准测试数值来说(Qwen 3.7已经不再开源,且不能部署在阿里云服务器之外的地方),在中国训练算力似乎不再那么紧张的背景下,双方的差距是进一步缩小而非扩大,大模型的壁垒在2026年是降低而非升高。         虽然从2025年下半年开始,OpenAI和Anthropic先后进入了GPT-5.X和Opus 4.X(4.5及以上)时代,在Coding和Agent上有了显著的提升,但是以Qwen、DeepSeek为代表的中国大模型相对美国顶级模型的差距并没有被拉大。

十六 |          生成PPT时,灵犀要求“图是图,表是表,图表是图表,文字是文字”。这些内容都是可以继续编辑的原生对象,而不是一张无法拆解的静态图片。

十七 |          例如,斯坦福大学《2026年人工智能指数报告》指出,中美模型自2025年初以来已经多次交替领先。截至2026年3月,美国最强模型只领先中国最强模型2.7%,差距长期维持在个位数区间,报告因此判断中美模型性能差距已经“实质性关闭”。面对论文等复杂文档,灵犀也能处理页眉、页脚、分栏和公式等排版要求。         可编辑,意味着用户可以继续工作;可溯源,意味着数据和修改过程能够核验;可协作,意味着成果可以进入多人审阅和反复修改的正式流程。只有满足这些要求,AI生成的内容才能成为真正可用的办公成果。         据介绍,灵犀专业版将以独立产品形态提供,同时进入WPS Office和Microsoft Office,并支持网页端和移动端。         从懂上下文,到端到端推进任务,再到交付原生Office文件,灵犀试图回答的是AI办公助理最基本的问题:当用户把一项真正的工作交给AI时,它能否少让用户解释背景,把事情推进到底,并交出一份可以核验、修改和继续协作的结果。

十八 |          GLM-5.2发布的时候同样引发了热议          6月发布的GLM-5.2进一步证明了上述论断。GLM-5.2延续了GLM-5的稀疏混合专家架构,通过针对长程编程任务的后训练,它的Coding能力已经全面接近Opus 4.8。甚至在某些场景下可以接近普遍认为达到“5万亿参数”的Fable 5。当AI能够做到这些,它才不再只是一个会回答问题的工具,而开始成为真正可以一起工作的办公助理。GLM-5.2在DeepSeek-V4预览版发布后,进一步动摇了“只有拥有更多先进GPU和更大的参数规模才能换来更强模型”的简单叙事,同时它的出现不断向世人昭示一种可能性:硬件的绝对优势似乎已经不再成为美国闭源模型真正的护城河。而Kimi K3的出现,则促使业界深入思考这一问题。         Kimi K3引发了股市下跌?不,但背后的问题更加深刻          这一疑问一旦深究,对于美股AI泡沫可能具有潜在致命打击的可能。

十九 | 为什么呢?因为本轮AI泡沫的核心假设是两个前提:只有更多先进GPU和更大的参数规模才能换来更强模型;更强的模型会在短期内(1—2年)带来通用人工智能并最终导致生产力的飞跃,也就是第四次工业革命。         所以基于这两个假设,美股投资会有两个推论:第一个推论是,因为有互联网泡沫爆炸后互联网产业繁荣的珠玉在前,所以当前对于AI基础设施的投资,是进入下一轮技术革命的门票。

| 购买GPU、建设数据中心和争夺电力资源,表面上是在进行一项回收周期漫长的固定资产投资,实际上却是在购买一张通向未来AI生态主导权的期权。只要通用智能或大规模智能体经济最终成为现实,当前投入的几千亿美元就可能被未来数万亿美元的新产业所消化。

|          第二个推论是,在这一窗口期内,微薄的资本回报暂时并不重要,抢占位置才重要。服务器会折旧,GPU会迭代,数据中心的单位建设成本可能下降,但一旦企业因为犹豫而失去模型、开发者、云客户和应用入口,未来再想重新进入竞争,付出的代价可能更大。因此,市场过去愿意容忍不断上升的折旧、下降的自由现金流,以及短期内难以量化的投资回报。         所以在过去的一年多中,AI硬件的资本开支是整个美股,乃至全球资本市场最重要的风向标。下游大厂也在疯狂投资建设AI数据中心,正如我上一篇文章中所说,仅亚马逊、微软、Alphabet和Meta四家公司2026年的资本开支合计就达到7000亿美元级别,综合来看,全美相关资本开支规模可与去年美国M2增量相提并论。         而巨额的资本开支背后就是各大公司自由现金流的急剧萎缩,亚马逊截至2026年3月底的过去12个月经营现金流仍高达1485亿美元,但自由现金流却已从一年前的259亿美元降至12亿美元。华尔街预计,到2026年第三季度,亚马逊、微软、Alphabet和Meta四家公司的单季合计自由现金流可能仅剩约40亿美元,而疫情以来它们平均每季度能够产生约450亿美元自由现金流。         这也迫使各大AI相关公司在2026年加速发债,根据摩根士丹利预计,2026年全球AI相关债券发行规模将由上年的水平翻倍至约5700亿美元;截至5月31日已发行约2360亿美元,并预计发行量将在下半年进一步上升。美国银行则把2026年五大云计算厂商新增债务融资预测由1400亿美元上调至1750亿美元。2025年,亚马逊、Alphabet、Meta、微软和甲骨文已经发行约1210亿美元公司债,远高于2020—2024年年均约280亿美元。         债务融资规模持续扩张,意味着AI投资风险正从科技巨头内部股东与自由现金流层面,向外扩散至全球公司债、银行信贷、私募信贷及基建融资市场。这也意味着,本轮AI投资正在从一场由科技巨头现金流支撑的产业豪赌,逐渐演变成一场由全球资本市场共同加杠杆的基础设施扩张。         更值得警惕的是,AI债务扩张并不完全发生在微软、Alphabet和亚马逊这些拥有高信用评级的科技巨头资产负债表内。随着数据中心建设规模扩大,越来越多项目被剥离至云运营商、数据中心开发商与特殊融资载体,而这些主体的信用质量明显弱于背后的科技巨头。         例如Oracle的债务等级已经被下调至BBB-,距离垃圾级仅一步之遥;CoreWeave和TeraWulf等直接承担AI算力建设的企业,则已经处于BB级非投资级区间。同样遭遇信用危机的还有融合了Xai的SpaceX,穆迪、惠誉和标普对其250亿美元债券给出的评级分别只有Baa1、BBB+和BBB,均处于投资级的中低区间。         可以说,无论Kimi K3是否恰好在此时发布,美国科技公司都已经走到了一个必须接受业绩验证以支撑其下一步持续投资价值的阶段性节点。         从指数的角度,纳斯达克已经横盘快两个月了,而SpaceX以及除了苹果之外的七姐妹都在近两个月出现了不同程度的回撤          在美联储仍然保持偏鹰表态、无风险利率长期停留在高位的背景下,美股AI交易继续依靠估值扩张上涨的空间已经明显收窄:资本开支必须继续超预期,云业务必须继续加速,AI收入必须开始兑现,企业还必须证明这些收入最终能够覆盖持续增长的折旧、电力和融资成本。         这也是自6月以来美国科技巨头率先开始回撤的核心原因:“除非真的在资本开支和业绩层面超预期,否则真的涨不动了”。         而Kimi K3的出现给了市场去思考的机会:美国这样不计成本的资本开支,包括刻意将AI芯片折旧周期从实际上的3年拉长至会计上的6年等一系列手段营造出的AI投资风潮,真的符合商业逻辑吗?          而中国模型的发展,恰恰使这个问题变得更加尖锐。在高端芯片供应仍然受限的背景下,中国企业不仅推出了成本较低、面向日常推理和Agent任务的DeepSeek-V4系列预览版,还推出了在编码和Agent基准中进入世界第一梯队的Kimi K3。美国的投资效率是否太低了?          这就将一个美国科技资本最不愿意面对的问题拿上了台面:假如受到芯片限制的中国企业,仍然可以通过模型架构、数据工程、强化学习和后训练优化,让自己的各类产品与美国产品在所有维度上竞争,那么美国在AI基础设施上的投入效率是否远低于市场此前的想象?          如果美国企业多投入数千亿美元,最终换来的只是一两个月的领先,开源模型甚至可能在下一轮更新中就追平的几个百分点基准测试的差距,那么这种硬件优势所能形成的商业定价权,就远没有此前想象的那样牢固。

| 他们也不要指望这样微弱的领先引领一个时代的工业革命,并在工业革命中享受超额期权回报了。

|          这已经不再只是一场关于模型性能的争论,而是对“美国例外论”在AI时代具体表现形式的拷问。因为从美国的角度来说,美国资本正在以前所未有的规模集中押注AI基础设施,赌AI会带来第四次工业革命,让他们绝地翻盘,毕竟他们已经不可能指望基础教育系统已经崩溃的美国为美国工业提供质优价廉的工人,提高工业效率,带来第四次工业革命了。         Kimi K3和DeepSeek-V4等中国大模型的存在,正在不断向世人指出一个现实,那就是无论AI是否将带来第四次工业革命,美国并不会因此理所当然享有超额经济收益与霸权溢价,因为哪怕AI确实带来生产率的飞跃,它也不会由美国闭源企业独占;因为中国企业能够以更低资本投入、接近同步的研发周期,推出性能相近的开源大模型。

|          这也就意味着,即便AI革命如期到来,支撑当前美股科技股估值的垄断利润也未必随之产生。换句话说,Kimi K3的出现质疑的并不是AI能否带来第四次工业革命,而是美国科技巨头是否能够独占这场工业革命的收益。         铁路改变了世界,互联网也改变了世界。铁路创造了现代经济,却没有让所有铁路公司获得超额利润;互联网重塑了人类生活,却同样埋葬了大量在泡沫时期投入巨资的企业。技术的社会价值与投资者的财务回报,从来不是同一件事。         人工智能大概率也将从根本上改变世界。但它改变世界的方式,未必符合那些试图通过制造“人工智能鸿沟”、限制技术扩散并长期收取垄断租金者的设想。         本文系观察者网独家稿件,文章内容纯属作者个人观点,不代表平台观点,未经授权,不得转载,否则将追究法律责任。关注观察者网微信guanchacn,每日阅读趣味文章。

|

Current article:http://www.caonaishengpengchuali.shop/list_nniuw/v20dx.ppt

Published on:21:56:46


相关文章
推荐图文
最热文章