广告人的大模型兵器谐
榜单满天飞,但没一个是写给厂告人看的每次新模型发布,朋友圈就刷一轮跑分:MMLU、SWE-bench, Arena排名热闹是热闹。但这些榜单衡量的都是同一件事这个模型聪不聪明此处贴图广告人要的不是聪明。我们要的是:brief扔进去,能不能还一个能用的东西[能用]=资料消化干不干净/洞察有没有真东西文案有没有语感/调性稳不稳/量产快不快、便不便宜。这是另一套评价体系。跑分软件测不出来一所以这篇不聊参数,只聊实战。
广告人看大模型,到底看什么?03文案语感与品牌腔调创意发散vs收敛多模态生产力不是「能写」,而是像这个品牌的嘴前期想100个点子,后期打磨3个方世界知识,资料消化,低幻觉。出图、向出分镜、出口播、出落地页040506长文本与策略推理成本与批量中文与合规80页brief、三年财报,吃下去给洞成本就是生死线梗、平台调性、广告法红线察
创意写作榜(EQ-Bench):目前最接近广告需求的第三方评测ClaudeOpus52430KimiK32340GPT-5.6Sol2092ClaudeFable52065MuseSpark1.12004GPT-5.51908GLM-5.21720KimiK2.61710Gemini3Pro1491DeepSeekV3.21489读法:LMArena测「读着舒不舒服],EQ-Bench测[写得好不好!-文案人重点看后者。前两名ClaudeOpus5与Kimi K3断层领先。来源:EVY聚合EQ-Bench/LMArena数据,2026-07-27(每周更新,Eo分制)
国际三强:各管一摊GPT-5ClaudeGemini3管[风格]管[逻辑]管[知识]稳、全、结构化文档强,最讲人话,文笔天花板,最讲条理,品牌叙事一世界知识牛逼,原生多模态,图文视英文长文案尤其顺绝频一体,Workspace打通
GPT-5(OpenAl)全能优等生,但有点「端着强项软肋写作用词干净、逻辑顺,英文长文案与结构化文中文偶尔有[翻译腔|,社交媒体文案要改才接地档(brief/提案/邮件)很稳,多模态理解强:读图、读表、读截图,配创意不够野,发散偏向安全答案,少惊艳威Canvas/联网/连Gmail日历偏贵,国内访问与合规零白行外理Agent能力到位,能跑多步工具调用,自动化重复活统一模型内置思考,上下文40万token,日常够用适用英文物料、提案文档、一切结构性输出,当[主力写手」。
Claude (Anthropic)最会讲逻辑的文案之神强项软肋表达力最强,写品牌故事、长文案、slogan打慢且贵,尤其Opus磨、人物独白最有[人味]多模态生成不是它的强项(理解可以,生图/生视安全与可控性行业第一,品牌敏感内容更稳,不频不是它的活)易越界冒犯国内可用性与合规同样要处理Sonnet4.6是性价比甜点(约$3/515每百万token,100万上下文)真要硬核长文用Opus4.8($5/$25)适用一切以文字质感取胜的活:品牌叙事、TVC旁白、 slogan精修。要文采,上Claude
Gemini 3 (Google)多模态怪兽,整台营销亲妈强项软肋原生多模态:文字/图像/视频/音频人训练起中文语感与本土文化梗弱于国产模型就揉在一起生态强绑Google,国内工作流整合成本高配套武器离谱:NanoBananaPro出图、Ved牛图/牛视频商业使用要过版权与名人声合规关系生成视频、深度绑Workspace.上下文恐怖:标准100万、Pro到200万token,是GPT-5的5倍Flash延迟低到[搜索级|,适合高频调用适用跨模态整合营销、读视频/读图/读文档的综合分析,重度Google生态团队。
国内军团:卷到极致,各有权杖国产模型已不是能不能用,而是谁更适合哪类活]。DeepSeek推理/成本王,开源可私有化通义干问Qwen最均衡的企业全能选手Kirmi超长文档与办公的最强外脑,低幻觉豆包/即梦离短视频最近,多模态接地气腾讯混元/元宝微信生态营销利器文心一言中文语义与合规标杆智谱GLM长文本分析Agent派MiniMax角色与音视频内容工厂
DeepSeek(深度求索)推理性价比之王,但不太说人话强项软肋推理/数学/代码顶尖,R1/V41慢思考能力极创意「冷|:逻辑满分,灵气欠奉,煽情/玩梗不如Claude与国产生活向模型便宜到离谱,API低至约$0.07-0.55/百万名横太与生活化五一船牛图生视频不具它的寡token道开源(MIT)可私有化,敏感数据不离城高峰期服务稳定性偶有波动上下文最长到100万token,长文处理跃升明显适用需严密逻辑的策略推导、数据整理、代码自动化,以及量大管饱的批量底层
通义千问Qwen(阿里)最均衡的企业全能选手/,写作能力比较看小情强项软肋综合能力均...