2026年2月 人工智能前沿详细总结(包括 Claude Opus 4.6、GPT-5.3-Codex、GLM-5、MiniMax M2.5、Qwen3.5-Plus、Gemini 3.1 Pro)
·
2月3日
【桌面智能体】OpenAI 发布 Codex 桌面版
- 今天,OpenAI 证实发布了
Codex的桌面版。这不仅是一个写代码的窗口,更是一个可以同时调用多个 Agent 的指挥部。 Codex桌面版可以实现多个任务并行切换。通过调用多个智能体开展工作,并通过工作树实现变更隔离,互不干扰;同时,它可以将工具和开发规范封装为可以复用的能力;另外,可以通过后台定时工作流,把重复性的琐事交给Codex处理。- 目前,
Codex桌面版仅在 macOS 上线,Windows 版本即将推出。作为限时福利,ChatGPT 免费用户和 Go 版本也可以用上Codex,而 Plus、Pro、Business、Enterprise 和 Edu 计划的用户,使用速率翻倍。
【大模型管理框架】清昴智能发布大模型管理框架 Xuanwu CLI
- 此前,
Ollama框架的发布让用户部署大模型时不再需要考虑 GPU 层面的细节。今天,清昴智能发布了Xuanwu CLI,用于让用户可以在部署大模型时不再考虑多种不同国产芯片之间的差异性。 - 目前,
Xuanwu CLI已经原生支持包括DeepSeek、Qwen3、GLM-4.7、MiniMax 2.1在内的数十款主流模型。与此同时,Xuanwu CLI在命令层面和Ollama高度一致,因此熟悉Ollama的用户可以快速上手Xuanwu CLI。
- ClawdBot 为什么这么火:和以前只能陪聊的 ChatBot 不同,ClawdBot 可以真正接管用户的电脑,例如可以在用户睡觉时写代码和修 BUG。
- Ollama 的概念:一个知名的开源跨平台本地大模型运行和管理框架,可以让用户在 Windows、macOS、Linux 本地设备上运行 Llama、Mistral、DeepSeek 等主流 LLM,而无需进行复杂的配置。
- 国产芯片架构的问题:百花齐放但不互通。例如,华为的 CANN、摩尔线程的 MUSA,以及各家自成体系的工具链彼此独立,不像 CUDA 具有近乎统一的格局。
2月4日
【桌面智能体】天工 Skywork 桌面版发布【重要】
- 今天,昆仑万维发布了全新的智能体天工
Skywork desktop,将 Windows 平台作为首发阵地。相较于 ClaudeCowork、OpenAI 新发布的Codex桌面版和最近大火的OpenClaw,首先推出了对 Windows 用户的支持。 Skywork desktop原生支持 Windows 系统,无需繁琐的迁移和适配,即可对本地历史文件和复杂项目场景开展自动化处理。- 除了对 Windows 平台的支持,
Skywork桌面版在基础模型选择、功能支持、能力扩展等其他维度也有亮眼的表现。在基础模型选择方面,增加了对 Gemini 模型的支持,充分发挥该系列模型的原生多模态理解和生成优势;用户可以自由选择使用Gemini 3 Pro、Claude Opus 4.5、Claude Sonnet 4.5等不同模型,也可以采用智能路由模式,自动识别任务类型并匹配最合适的模型。 - 在办公支持方面,
Skywork桌面版实现了对全类型文件的智能管理,包括图片、视频、表格、Word 文档、Excel 文档、PDF 文档和 PPT 等,可以跨文件跨格式地读取和理解。它能够同时响应并执行多项复杂任务,同时支持本地执行,避免了数据和文件泄露的风险。 - 在能力扩展方面,
Skywork内置了超过一百个精选的、有用的 Skills 技能包,并将控制权交给用户,可以手动选择也可以根据任务类型自动筛选,包括了 Office 三件套生成、网页生成、视频和图像生成。 - 价格上,
Skywork桌面版仅需 19.99 美元/月即可解锁基础会员,获得完整的产品体验。
【全模态大模型】首个全双工全模态大模型 MiniCPM-o 4.5 发布
- 今天,面壁智能开源了行业首个全双工全模态大模型
MiniCPM-o 4.5,相比于全模态模型,MiniCPM-o 4.5首次实现了“边看边听边说”以及“自主交互”的全模态能力。模型不再只是把视觉、语音输入作为静态输入处理,而是在实时、多模态信息流中持续感知环境变化,并且在输出的同时保持对外界的理解。 MiniCPM-o 4.5的参数量为 9B,但是在全模态、视觉理解、文档解析、语音理解与生成、声音克隆等方面均实现了全模态 SOTA 水平。超越了Qwen3-Omni-30B-A3B-Instruct、Qwen3-VL-8B-Instruct、Gemini 2.5-Flash-nonthinking、CosyVoice2等模型。MiniCPM-o 4.5在提升能力密度的同时也极大提高了能效比:以更低的显存占用、更快的响应速度,实现更高的推理效率和更低的推理成本。- 目前,
MiniCPM-o 4.5已经在 Github、HuggingFace 等平台开源。
2月5日
【图像生成模型】超强论文配图模型 PaperBanana 发布【重要】
- 今天,谷歌和北大联合发布了科研配图模型
PaperBanana。 - 相较于以往的绘图模型,
PaperBanana使用了五个智能体:第一个智能体负责在收到任务后,从顶会数据库中查找十张最相关的参考图;第二个智能体负责把论文中复杂的文字逻辑拆解为视觉蓝图;第三个智能体负责按照顶会的标准对第二个智能体的结果进行风格调整;第四个智能体负责调用Nano Banana Pro进行图像生成,而第五个智能体用于找茬,即用原始论文和当前图像进行比对并循环这个过程。 PaperBanana还进行了另外一项创新,即如果用户所画的图像为带有数据的图像时,会自动使用 Python Matplotlib 进行绘图,而不是继续使用图像生成模型进行绘图,确保了绘图结果的准确性。
【深度研究智能体】最强深度研究智能体 Qianfan-DeepResearch Pro 发布【重要】
- 今天,深度研究智能体权威评测榜单 DeepResearch Bench 公布最新结果,百度千帆深度研究智能体
Qianfan-DeepResearch Pro登顶榜首,超过了 OpenAI、Google、Anthropic 等一众国际顶尖选手。另外,Qianfan-DeepResearch也取得了第二名的成绩。 Qianfan-DeepResearch Pro在全面性、洞察力、指令遵循度、可读性上,都实现了全面领先。- 相较于其他的深度研究,
Qianfan-DeepResearch Pro不会笼统作答,而是通过多轮交互,确定用户的关注点,从而保证研究方向不跑偏。其次,它允许用户在开始前修改和增删大纲,让用户对研究路径具有掌控权;最后,在结果交互方面,其专业且结构化。
2月6日
【多模态大模型】最强模型 Claude Opus 4.6 发布【重要】
- 今天,Anthropic 发布了最新模型
Claude Opus 4.6。 Claude Opus 4.6最直观的进步是引入了 1M token 的超长上下文窗口,极大改善了模型在处理长文本时的上下文衰减情况;在大海捞针的“MRCR v2.8-needle 1M"基准上,Claude Opus 4.6以 76% 的得分远超Claude Sonnet 4.5的 18.5% 得分;在评估在线检索难获取信息能力的基准 BrowseComp 上,Claude Opus 4.6也排名行业第一。- 根据官方说法,对于财务分析、科学研究以及 Office 三件套,
Claude Opus 4.6都可以轻松处理。在综合评价金融、法律和其他领域经济价值知识工作任务的基准 GDPval-AA 上,Claude Opus 4.6比第二名的GPT-5.2高出了 144 个 Elo;该模型同时还在编程基准 Terminal-Bench 2.0 中取得了最高分,并且在“人类最后的考试”中领先其他所有模型。 Claude Opus 4.6也引入了自适应思考功能,可以自主判定什么时候需要进行深度推理。另外,它也引入了上下文压缩,当对话长度接近上下文窗口上限时会自动摘要并替换旧的对话内容,方便长对话和智能体任务。- 在能力提升的同时,
Claude Opus 4.6的安全性并未下降。在自动化行为审计中,Claude Opus 4.6的对齐水平极高,同时,欺骗、奉承等负面行为极少。 Claude Opus 4.6已经在官网、API 和所有主流的云平台上限,仍然采用和之前相同的定价标准:每百万 token 输入/输入的价格分别为 5 / 25 美元。
【编程模型】编程模型 GPT-5.3-Codex 正式上线【重要】
- 今天,在
Claude Opus 4.6发布仅 15 分钟后,OpenAI 也发布了最新最强的编程模型GPT-5.3-Codex。该模型开始主打美学品味:无论是自主持续消耗 Token 进行游戏开发,还是在提示词不全的情况下进行网页开发,又或者是在计算机使用能力上,都获得了显著提升。 GPT-5.3-Codex的主要亮点如下:基准测试集成绩提升,在 TerminalBench 2.0 上更是以 77.3% 的成绩超越了刚刚发布的Claude Opus 4.6(65.4%);支持任务进行过程中的实时引导,可以随时调整方向并获取更新;在完成相同任务时消耗的 token 数量不到GPT-5.2-Codex的一半,单 token 生成速度提升 25%;具有很强的计算机操作能力。
2月7日
【视频生成模型】视频生成模型 Kling-3.0 正式发布
- 今天,快手正式发布了最新版的视频生成模型
Kling-3.0。该模型支持智能分镜,具有很强的音画同步和主体一致性能力,同时具有很气将的文字一致性。 Kling-3.0提供了智能分镜和自定义分镜两种方式,让用户可以生成高质量和数量的分镜视频。另外,模型的配音支持使用中国方言。
2月10日
【图像生成模型】超强图像生成模型 Qwen-Image-2.0 发布
- 阿里刚刚发布了新一代图像生成及编辑模型
Qwen-Image-2.0。该模型支持输入 1K 长度的文本提示词、在图像中嵌入复杂信息、强大的中文渲染能力、多图编辑、2K 分辨率生成。在国际评测中,该模型的表现仅次于Nano Banana Pro和GPT Image 1.5。 - 在能力提升的同时,该模型的体量更轻,部署门槛更低,生成速度更快,尤其适用于高频 Prompt 调试、实时展示和交互式创作等使用场景。
- 目前,阿里云百炼平台已经开放了 API 进行用户测试。开发者也可以通过 Qwen Chat 免费体验新模型。
【代码智能体】CodeBrain-1 框架获智能体真实工程能力榜单全球第二
- 在被 Anthropic 和 OpenAI 视为智能体真实工程能力的全球权威基准 Terminal-Bench 2.0 榜单上,中国团队 Feeling AI 凭借框架
CodeBrains-1,搭载最新的GPT-5.3-Codex模型,冲击到了全球排行榜第二,成为了榜单前十唯一的中国团队,仅次于 OpenAI 的Simple Codex(搭载GPT-5.3-Codex),超过了 Factory 的 Droid(搭载Claude Opus 4.6)。 - Terminal Bench 的任务类型包括复杂的系统操作,以及大量需要在终端环境中完成的编码任务。
2月11日
【大语言模型】一流推理模型 星火大模型X2 发布
- 今天,科大讯飞正式发布了
星火大模型X2。该模型相较于上一代的星火X1.5大模型,推理性能提升了百分之五十,并且完全基于国产算力。 星火大模型X2的模型通用能力突出,在基准测试上稳居行业一流水平,即使是和GPT-5.2、Gemini 3 Pro在内的国际顶尖模型相比也毫不逊色,尤其是在数学计算、逻辑推理等核心能力上表现亮眼,并且在 130 多种语言综合能力上依旧稳稳保持国家队水平。- 在 AIME 2025 测试中,
星火大模型X2取得了 95.7 分,仅次于GPT-5.2 (xhigh),具备了国产模型中顶尖的数学能力;在 MMLU Pro 上,星火大模型X2以 87.3 分在国产模型中夺冠,并且与GPT-5.2持平,在知识广度和深度上达到了国际一流水平。 - 另一方面,依靠深度优化的算法、高质量垂直领域数据和行业专家参与,
星火大模型X2的场景落地更进一步。
【OCR模型】最强 OCR 模型 GLM-OCR 发布【重要】
- 今天,智谱正式发布并开源了
GLM-OCR。该模型的参数仅为 0.9B,但是在 OmniDocBench V1.5 上取得了非常好的成绩,超过Gemini 3 Pro、GPT-5.2、PaddleOCR-VL-1.5、DeepSeek-OCR2、MinerU2.5等众多竞争对手,在手写体、代码文档、印章识别、跨单元格等场景的性能表现达到 SOTA。 - 根据官方信息,
GLM-OCR在通用文本识别、复杂表格解析、信息结构化提取方面具有很强大的能力 - 经过实际测验,
GLM-OCR在解析较为规整的 Word 文档、PPT 文档、论文和教材表格,解析不太抽象潦草的手写体、收据、代码和合同扫描件、解析日常生活工作中的会议纪要、白板字迹等场景中适用性较高。
2月12日
【多模态大模型】全球最强开源模型 GLM-5 发布【重要】
- 今天,代号为 Poly Alpha 的强大模型终于公布,即为智谱的
GLM-5,并且成为了全球当前最强的开源模型。在权威榜单 Artificial Analysis 中,GLM-5位列全球第四(落后于Claude-Opus-4.6、GPT-5.2 (xhigh)和Claude-Opus-4.5),开源第一,超越了Gemini-3-pro、Kimi K2.5、Claude-4.5-Sonnet、DeepSeek V3.2等众多竞争对手。 - 相较于上一代的模型,
GLM-5的参数量达到了 744B(激活参数 40B),预训练数据也从 23T 增长到了 28.5T。为了降低训练成本,它首次集成了 DeepSeek 提出的稀疏注意力机制,使得在处理超长上下文时不仅可以保持无损的记忆力,还可以大幅降低部署成本。 - 在编程上,
GLM-5在 SWE-bench Verified 取得了 77.8 分,Terminal Bench 上取得了 56.2 分,都是开源模型第一,超越了Gemini 3.0 Pro,更是接近Claude Opus 4.5。 - 在智能体能力上,
GLM-5在 BrowseComp(联网检索)、MCP-Atlas(工具调用)和复杂规划任务的基准上全部获得了开源第一。 - 另外,
GLM-5已经完成了与华为昇腾、摩尔线程、寒武纪等主流国产平台的深度适配,使得GLM-5在国产芯片集群上也可以跑出高吞吐、低延迟的表现。
【图像编辑模型】小红书发布图像编辑模型 FireRed-Image-Edit
- 今天,小红书正式发布了图像编辑基础模型
FireRed-Image-Edit,该模型在处理复杂编辑指令、风格转换、高精度文字编辑等多个核心指标上具有强大实力。 - 对比结果显示,
FireRed-Image-Edit凭借更精准的理解力、更强的 ID 保持度和高效架构,在多项权威测试中表现优异。在 ImgEdit、GEdit 等多个榜单中超越LongCat、Flux 2、Qwen、Seedream-4.0等模型,取得了业内 SOTA。 - 目前,
FireRed-Image-Edit的项目代码、技术报告和 Demo 网页已经全部开源,模型权重也将在未来几天开源。
2月13日
【推理智能体】谷歌重磅更新 Gemini 3 Deep Think【重要】
- 今天,谷歌发布了
Gemini 3 Deep Think的重大升级,专门用于复杂任务的推理,代表了 AI 前沿的最强智能水平。 Gemini3 Deep Think在“人类最后的考试”中取得了 48.4% 的成绩(在不使用任何工具的情况下);在 ARC-AGI-2 上取得了前所未有的 84.6% 的成绩;在 Codeforces 上取得了 3455 的分数(世界排名第八);在 2025 年国际数学奥林匹克竞赛中取得金牌。各类表现超越了Gemini 3 Pro Preview、Claude Opus 4.6、GPT-5.2在内的众多其他顶尖模型。- 相较于之前其他模型(例如
o3-preview)的好成绩,Gemini 3 Deep Think的成本降低了几百倍。 - 全新的
Gemini 3 Deep Think已经在 Gemini 应用中上线,目前 Google AI Ultra 用户可以使用。此外,谷歌还以 API 的方式向部分研究人员、工程师和企业开放了使用权限。
【大语言模型】开源模型新王 MiniMax M2.5 发布【重要】
- 今天,
MiniMax M2.5正式发布。该模型在编程测试中,已经完全缩小了和Claude Opus 4.6这类全球最顶尖大模型的差距,并且价格只有后者的二十分之一。只需要花费一美元,即可让模型以 100 token/s 的速度运行一个小时。 MiniMax M2.5具有极致的推理效率,推理速度达到了Claude Opus 4.6的三倍;另外,模型在 Excel 数据处理、深度搜索和长文档摘要等核心生产力场景,都居于 SOTA 地位;另外,由于模型的激活参数只有 10B,是第一梯队中参数最小的旗舰模型,因此在私有化部署、显存占用和推理能效比上具有压倒性优势。- 该模型不仅性能媲美
Claude Opus 4.6,还是第一个超越Claude Sonnet系列的开源模型。
【视频生成模型】爆火视频生成模型 Seedance 2.0 正式发布【重要】
- 今天,字节跳动正式发布视频生成模型
Seedance 2.0。 Seedance 2.0支持图像、视频、音频、文本四种模态输入,表达方式更加丰富,生成结果也更加可控。用户可以用一张图来说明自己想要的画面风格,用一个视频制定角色的动作和镜头的变化,用一段音频表达预期的节奏和氛围。提示词不再局限于文字。- 在多模态参考生成、复杂音视频指令遵循、复杂运动稳定性、专业镜头语言、音视频表现力以及视听一体化等多维度测评中,
Seedance 2.0的表现均处于业内领先。其在运动稳定性、指令遵循和画面美感方面均有显著提升。 - 目前,用户可以在豆包 APP、电脑端、网页版以及即梦 APP、即梦网页版中体验该模型。豆包 APP 和即梦 APP 支持真人出镜,用户需要先通过录音录像完成真人校验,才能生成本人形象的数字人分身,并使用该分身生成 AI 视频。
【编程模型】实时编程模型 GPT-5.3-Codex-Spark 发布
- 今天深夜,OpenAI 发布了新模型
GPT-5.3-Codex-Spark,该模型是 OpenAI 史上最快的模型。 GPT-5.3-Codex-Spark是 OpenAI 首个为实时编程设计的模型,被称为“超高速模型”,其生成速度超过了 1000 token/s,体感接近瞬时响应。之所以可以实现这种效果,这是因为该模型运行在一家芯片巨头厂商的专用 GPU 集群上,并且进行了各种类型的优化。- 尽管模型变快,但是能力同样强大。在评估智能体软件工程能力的 SWE-Bench Pro 和 Terminal-Bench 2.0 两项基准测试中,
GPT-5.3-Codex-Spark都显现出了强大的性能。
2月14日
【多模态大模型】国内最强 Doubao-Seed-2.0 系列模型发布
- 今天,字节跳动正式发布了
Doubao-Seed-2.0,它是最新的多模态智能体大模型,也是豆包大模型从 2024 年 5 月发布以来的首次大版本迭代升级。该模型在 LMArena 上取得了总排名第六的成绩,位列中国模型第一;在众多分榜单上也有非常好的表现。 Doubao-Seed-2.0增强了幻觉压力下的视觉推理能力,并改进了文档和图形的结构化解析能力;另外,它提供了多种体量型号,包括 Pro、Lite 和 Mini 三款通用智能体模型和代码模型,以应对不同场景下延迟和性能的权衡。Doubao-Seed-2.0专为大规模生产环境中提供最佳用户体验而设计,在多模态理解,企业级 Agent 能力以及推理代码能力三个维度上实现了质的飞跃。- 在数学与视觉推理方面,
Doubao-Seed 2.0 Pro在多个数学推理基准上达到 SOTA 水平,在科学领域的整体成绩和Gemini 3 Pro相当;在视觉感知能力基准中,取得了业内最高分;在推理和智能体能力评测中,Doubao-Seed-2.0 Pro在 IMO、CMO 和 ICPC 中取得了金牌,并且在 Putnam Bench 上超越了Gemini 3 Pro。在人类最后的考试中,Doubao-Seed-2.0 Pro取得了最高分 54.2 分。 Doubao-Seed-2.0系列模型还重点强化了指令遵循能力,以保持较强的一致性和可控性。- 目前,该系列模型的 API 已经在火山引擎上线。
【图像生成模型】图像生成模型 Seedream 5.0 Lite 发布
- 今天,字节同时发布了新一代图像生成模型
Seedream 5.0 Lite。相较于Seedream 4.5,它在理解、推理和生成能力上都实现了全面跃升。 Seedream 5.0 Lite采用多模态理解生成统一架构,能够像人类设计师一样洞察用户意图,即使面对简短模糊的描述也可以准确推测创作需求,在主体一致性和图文对齐等方面的表现显著提升。其内置的世界知识体系覆盖科技和人文多个垂类领域,生成的结果更符合物理规律,信息可视化能力大幅增强。Seedream 5.0 Lite首次引入了实时检索增强能力,可以通过联网获取最新的知识和咨询,精确对应时效性的创作需求,在资讯海报等场景中的表现尤为出色。
【具身智能模型】最强具身智能基础模型 GigaBrain-0.5M* 发布
- 过去一段时间,极佳智能的模型
GigaBrain-0.1曾经在 RoboChallenge 上获得全球第一,超越了Spirit-v1.5、pi0.5等竞争对手。今天,它的进化体 GigaBrain-0.5M* 正式发布。 GigaBrain-0.5M*是一款性能更加强大的 VLA 模型,依靠世界模型进行驱动。模型以世界模型对未来状态和价值的预测结果作为条件输入,可显著提升模型在长时程任务中的鲁棒性。在此基础上,模型引入了人在回路的持续学习机制,最终实现“行动-反思-进化”的闭环式持续学习和自主迭代升级。
2月16日
【多模态大模型】最强开源模型 Qwen3.5-Plus 发布并开源【重要】
- 今天,阿里新发布了全新一代大模型
Qwen3.5-Plus,该模型性能正面硬刚Gemini 3 Pro和GPT-5.2,价格却只有Gemini 3 Pro的 1/18,即 0.8 元 / 1M token。 Qwen3.5-Plus在 MMLU-Pro 中取得 87.8 分,超越GPT-5.2;在博士级科学推理评测 GPQA 中获得 88.4 分,超越Claude 4.5;在指令遵循 IFBench 上以 76.5 分获得了最高的 SOTA;在通用智能体评测基准 BFCL-V4 和搜索智能体评测基准 BrowseComp 上,表现均超越了Gemini 3 Pro和GPT-5.2。- 除了性能强大,
Qwen3.5-Plus的效率更是恐怖。模型的总参数为 397B,激活参数为 17B,以不到 40% 的参数量,性能上超越了自家的万亿参数大模型Qwen3-Max。推理吞吐量上,在常用的 32K 上下文场景中提升了 8.6 倍,在 256K 超长上下文情况下,最大提升到 19 倍。
2月18日
【多模态大模型】Claude Sonnet 4.6 发布【重要】
- 今天,Anthropic 发布了被他们称为“当前能力最强的 Sonnet 模型”的
Claude Sonnet 4.6。该模型在编程、计算机使用、长上下文推理、智能体规划、知识工作和设计上进行了全面升级,Beta 版还包含 100K Token 的上下文窗口。 Claude Sonnet 4.6在计算机使用方面提升显著,在其他各项基准测试中的成绩均有提升,智能水平接近Claude Opus 4.6,但是价格更加实惠。在权威的 AAII 评测中,Claude Sonnet 4.6的评分仅次于Gemini 3.1 Pro Preview和Claude Opus 4.6 (max),高于GPT-5.2 (xhigh)、GLM-5等一众模型。- 价格方面,对于免费版和专业版用户,
Claude Sonnet 4.6已经成为了 claude.ai 和 Claude Cowork 的默认模型,定价和Claude Sonnet 4.5一致(3 美元 / 1M 输入 Token,15 美元 / 1M 输出 Token)。
2月19日
【音乐生成模型】Gemini 上线音乐生成模型 Lyria 3
- 今天,谷歌在 Gemini APP 中上线了 AI 音乐生成的功能,用户可以通过输入一段文字描述、上传一张图片,在几秒钟内得到一首三十秒的完整歌曲。歌曲带人声、歌词和 AI 生成的封面。对于纯器乐也支持。
- 驱动该功能的是 DeepMind 的最新音乐生成模型
Lyria 3。相较于前一代模型,该模型可以根据提示词自动生成歌词,并且在风格、人声类型、节拍速度等方面的控制也更加精细了。 - 该功能目前以 Beta 形式向全球所有用户开放,支持英语、德语、西班牙语、法语、印地语、日语、韩语和葡萄牙语,谷歌的 AI Plus、Pro 和 Ultra 用户将享受更高的使用额度。
2月20日
【多模态大模型】最强大模型 Gemini 3.1 Pro 发布【重要】
- 今天,谷歌发布了下一代旗舰模型
Gemini 3.1 Pro,刷爆了全领域的 SOTA,成为当前最强的大模型。 Gemini 3.1 Pro实现了大模型推理能力的飞跃。在极为严苛的 ARC-AGI-2 测试中,它获得了 77.1% 的高分,是上一代模型Gemini 3 Pro的两倍多;在 ARC-AGI-1 上更是接近满分(98%),超过了满思考的Claude Opus 4.6和GPT-5.2;在编程和推理领域,Gemini 3.1 Pro也是全面碾压 Claude 和 GPT。在 AAII 综合评测中,Gemini 3.1 Pro强势获得了第一名,不仅总分领先Claude Opus 4.6足足四分,API 调用成本更是不足一半。- 在“人类最后的考试”(HLE)中,
Gemini 3.1 Pro在没有工具辅助的情况下获得了 44.4% 的成绩,远超GPT-5.2的 34.5% 和Claude Opus 4.6的 40.0%。代码方面,在 LiveCodeBench Pro 中获得 2887 的 Elo 积分,断层领先其他模型;在 Terminal-Bench 2.0 上,以 68.5% 的得分压制了代码大模型GPT-5.3-Codex的分数 64.7%。智能体方面,在 APEX-Agents 中,以 33.5% 的成绩超越了其他所有模型,包括第二名的Claude Opus 4.6(29.8%)。在 MRCR v2 的 128k 上下文测试中,获得了 84.9% 的高分,在 1M 的最高难度测试中获得了 26.3% 的成绩,而GPT-5.2和Claude Opus 4.6直接不支持这么长的上下文。最后,相较于上一代模型,Gemini 3.1 Pro相较于 Gemini 3 Pro 的幻觉率也明显下降。 Gemini 3.1 Pro具备原生的多模态输入能力,支持 1M 的超长上下文。- 目前,
Gemini 3.1 Pro已经在 Gemini 和 NotebookLLM 中上线,开发者也可以通过 Google AI Studio、Antigravity 以及 Android Studio 进行体验。

2月25日
【视频生成模型】最强图生成视频模型 Grok-imagine-video-720p 发布【重要】
- 今天,xAI 的图生视频模型
Grok-imagine-video-720p登顶了 LMArena 上的图生视频排行榜榜首,获得了高达1404的 ELO 分数。从一些基准测试上,Grok-imagine-video-720p击败了谷歌的Veo-3.1,并且具有更低的生成成本。 - 该模型有三项特别强大的能力:视频生成和指令遵循能力、零门槛的视频编辑能力、更快的速度和更低的生成成本,尤其是精准的指令遵循能力,被一些第三方机构的专业评测中着重指出。
2月27日
【视频生成模型】超强视频生成模型 SkyReels-V4 发布【重要】
- 今天,昆仑天工正式发布了多模态视频基础模型
SkyReels-V4。在 Artificial Analysis 的榜单中,SkyReels-V4在文生视频的模型榜单中排名全球第二,仅次于Kling 3.0 Pro。 SkyReels-V4支持文本、图像、视频等多种模态输入,支持 1080P 分辨率、32FPS 帧率、最长15秒的电影级画质输出,实现了音频和画面的精准同步,并可以全面覆盖从创意构思到精细编辑在内的一站式视频创作工作流。SkyReels-V4是全球首个同时支持多模态输入、联合音视频统一生成和编辑任务的基础模型,方便用户进行端到端的创作。
更多推荐


所有评论(0)