0025年A|大樟型资料汇编2025年12月
可持续性成本效率能力竞赛工程化生态锁定模型之争:从能力竞赛"到"可持续性乙战2025年,头部模型的竞争不再是单纯的基准分数比拼。玩家们在不同的战略路径上分化在极能力、成本效率、工程化和生态锁定之间做出艰难取舍。NotebookLM
OpenAl的前联合创始人AndrejKarpathy:2025年的四场关键转变本次回顾将深入剖析定义了2025年的四个层面上的结构性转变。这些转变不仅解释了今年的重大事件,也为未来的发展指明了方向。新王登基:竞争格局的决定性倾斜引擎革命:从"人工反馈"到“可验证奖励谷歌Gemini3全面超越GPT系列,打破OpenAl的领先神话。中训练范式从RLHF演进至RLVR,模型通过自我验证实现推理能国模型以惊人的成本效益实现“弯道超车”。力飞跃,成为年度最重要的技术拐点。3智能异形:“锯齿状”能力结构凸显范式跃迁:从聊天框到深度集成工作流模型在致理等领域展现“鬼才”级能力,却在常识上频测短板,AI应用从通用助手进化为专用工具和自主智能体,深度入编程。对“适用智能"的评估陷入新困境。办公等专业流程,引发新的生态博弈。NotebookLM
谷歌的绝地反击:Gemini3终结OpenAI的领先时代2025年11月,谷歌发布Gemini3,其性能在关键基准上不仅超越了GPT-5.2,更标志着谷歌从追赶者重返行业领导者地位。ARC-AGI-2基准测试(“AI图灵测试")40%技术优势:Gemini3在数学竞赛、多模态31.1%6理解和复杂推理方面表现尤为突出、原牛支持视频、图像处理与工具调用。30%战略自主:模型完全基于自研TPUV5芯片20%17.6%6训练,摆脱了对英伟达GPU的依赖10%市场影响:发布后,英伟达股-790价应声下跌7%,市场震动。Gemini3GPT-5.2NotebookLM
实用主义路线:聚焦工程效率与开放生态AnthropicClaude:深耕代码与智能体工作流,主打“高质量/高效率工具调用·产品定位:ClaudeSonnet 4.5和Opus4.5明确面向agenticworkflows (如agentic代码迁移、重构),强调“用电脑/用工具完成任务”。任务分解代码生成workflow·成本意识:官方材料突出“减少token使用/更高效率”,直接回应企业对推理成本、吞吐量和稳定性的核心关切。其路线是:将推理能力置于可控工作流中,结果验证确保单位成本下的可用性,开源生态(Llama/Mistral):焦点从“模型发布”转向“可部署性与生态扩散欧盟AI法案背景下的合需求·现实需求:政企与行业场景优先选择“能在私有云安全运行、可被审计、成本可控”的方案,而非最强的闭源AP。全球视角:oMeta(Llama3已于2024年发布)持续建设工具链与社区生态oMistral等欧洲力量在欧盟AI法案(AIAct)背景下,满足了市场对"在地合规、可审计”的强需求,成为地缘战略的一部分。NotebookLM
巨头们的攻防战:成本、代码与多模态在谷歌强势反攻的同时,其他主要参与者也在各自的优势领域深化布局,但OoenAl面临严峻的盈利挑占OpenAIO系列与盈利困境AnthropicClaude多模态成为标配的“代码壁垒推出GPT-5.0/5.1。ClaudeOpus4.5。2025年被称为/5.2系列,强调("Sonnet")在“多模态模型扩指导推理能力,代码生成和复杂张之年”但引发“个性”推理上表现卓越,OrogleAl普追增成本变保守的争议一度领先同期加对图像、语音、OpenAl模型,视频的理解与生.发布本地AI助手成能力。Claude Code,并·2025年被称为“多模态模型扩张之引入"可调节计算预算"机制,兼顾.主流模型(如GPT-4Vision,Google性能与成本。VEO)普遍增加对图像、语音、视频的理解与生成能力,AI从“能说会道”进化为“能看会听"。KNotebookLM
训练范式革命:从RLHF到RLVR的飞跃2025年模型能力飞跃的根本原因,是训练方法从依赖主观人类反馈(RLHF)转向了基于客观事实的可验证奖励强化学习(RLVR)左侧(旧):RLHF-人类反馈强化学习右侧(新):RLVR-可验证奖励强化学习模型生成更新模型模型生成更新模型自动验证器人类评估(数学题对?(主观,昂贵,不稳定)代码运行成功?)客观奖励信号(客观,廉价,稳定)RLVR的颠复性优势客观稳定:奖励信号明确,可进行大规模、长时间的优化。涌现推理:让模型学会自我检验和多步思考,直至问题解决。更高性价比:各大实验室将算力预算从“扩大规模”转向“RLVR深度训练”,实现了能力的非线性增长转折点:Ope...