MIAOYUN | 模型上新及AI新鲜事儿 260731
本周AI行业迎来集中更新:MIAOYUN接入Kimi K3,多家厂商发布并开源多模态、语音、智能体类新模型;腾讯、企业微信落地多款办公AI工具,同时开源推理加速、代码安全工具;底层方面MCP架构升级、Claude适配AMD GPU冲破CUDA壁垒,微软、华为补齐智能体训练体系;市场层面NVIDIA成立AI安全联盟,大量科研人员联名倡议管控前沿AI研发进度,行业步入技术落地与安全规制同步推进阶段。一起来回顾本周发生的AI新鲜事儿吧!
模型上新
「秒云Tokens管家」模型上新,上架月之暗面最强旗舰开源模型「Kimi K3」
7月28日,「秒云Tokens管家」模型上新,上架月之暗面最强旗舰开源模型「Kimi K3」。依托平台成熟算力调度、统一Token计费、高稳定在线服务能力,结合「Kimi K3」2.8万亿参数、原生多模态、百万Token超长上下文、顶尖长程编程与自主Agent能力,为开发者、科研团队、企业研发带来零门槛、低成本、全功能的前沿大模型调用方案。
- 月之暗面最新Kimi K3、Kimi K2.7 Code编程模型,原生多模态模型Kimi-K2.6、K2.5系列;
- 阿里通义千问Qwen3.7、Qwen3-max-2026-01-23、Qwen3.6、3.5系列
- 智谱最新旗舰模型GLM-5.2、GLM-5.1、GLM-5;
- 稀宇科技原生多模态旗舰模型MiniMax M3、MiniMax M2.7、M2.5;
- 字节豆包Seedance 2.0视频生成模型
- 深度求索最新旗舰级MoE模型DeepSeek-V4系列,含Pro、Flash版本、V3、V3.1、V3.2、R1系列;
- 海外顶级大模型等……
详情:模型上新
AI 大模型
Black Forest Labs推出多模态模型「FLUX 3」,统一图像音视频与动作预测
7月24日,Black Forest Labs(黑森林实验室)推出全新多模态统一模型「FLUX 3」,基于Self-Flow技术打造,可一体化处理图像、带原生音频的720p长视频、音频并支持动作预测,适配内容创作与机器人仿真场景;视频生成综合评测优于Seedance 2.0等竞品,人脸、音画同步、文字渲染能力亮眼;产品将分阶段上线,开发者版「FLUX 3 Dev」计划开源,可服务内容创作与机器人物理AI场景。
参考:Black Forest Labs发布Flux 3!初评超过Seedance 2.0,将开源
百灵大模型推出原生混合推理模型「Ling-3.0-flash」
7月24日,百灵大模型推出原生混合推理模型「Ling-3.0-flash」,总参124B、激活仅5.1B,依托原生混合线性注意力、KDA细粒度记忆、1/64稀疏MoE架构大幅提升算力转化效率,Agent能力全面升级,扩充万级交互训练环境,搭配集群分层缓存让长文本TTFT降低60%-80%,新增多智能体协同纠错机制;模型原生支持256K上下文、最高可扩至1M,可完成3D建模、科研论文产出、办公自动化、网页开发等多元生产力任务,多项测评超越万亿级竞品,平台限时免费API至8月3日,结束后开源权重。
Anthropic发布「Claude Opus 5」,性能逼近Fable 5,定价仅为后者一半
7月25日,Anthropic推出全新「Claude Opus 5」,全产品线上线,拥有100万上下文窗口,知识截止至2026年5月;其抽象推理、工具调用、代码查错能力突出,多项评测接近甚至优于Fable 5,定价与Opus 4.8持平,仅为Fable 5一半,还提供提速2.5倍的Fast Mode;二者定位有差异,Fable 5擅长深度推理、高精专业任务,Opus 5更适配大规模Agent与工程落地,实测可检出其他模型遗漏的程序漏洞;同时官方优化Claude Code,大幅精简系统提示词并给出全新使用思路,减少冗余规则、依托环境约束释放模型自主判断空间,适合日常代码开发、方案评审、UI设计等常规业务场景。
参考:Claude Opus 5深夜发布,以一半价格逼近Fable 5。
美团开源万亿参数模型「LongCat 2.0」,上线全场景AI Agent平台「CatPaw」
7月27日,美团开源1.6万亿参数、原生支持百万Token上下文的「LongCat 2.0」模型,该模型完成五万张国产算力卡全流程训练推理;依托该模型打造的全场景AI Agent平台「CatPaw」同步上线,已在美团内部覆盖9万员工、落地3万个Agent,配备移动端与PC客户端,支持7×24小时云端运行,具备自主任务拆解、多Agent并发、长期记忆、流程录制生成技能等能力,内置本地生活行业专属AI专家工具,可搭建企微、飞书数字员工;平台提供企业级托管能力,搭载沙箱隔离、分级权限、私有化部署等合规安全方案,配套统一运维后台,实现从自研大模型到行业AI智能应用的完整落地闭环。
参考:从 LongCat 2.0 到 CatPaw:万亿参数模型落地,美团全场景 AI Agent 正式上线
月之暗面开放2.8万亿参数MoE混合专家模型「Kimi K3」完整权重
7月27日,月之暗面开放2.8万亿参数MoE混合专家模型「Kimi K3」完整权重、发布配套技术报告,并开源MoonEP、FlashKDA、AgentEnv三项核心训练底层技术。「Kimi K3」具备原生视觉能力、支持100万Token超长上下文,依托KDA、注意力残差、MoonEP等创新技术,规模化算力产出效率较前代提升2.5倍,技术报告详细披露Stable LatentMoE、MoonViT-V2、百万Token上下文强化学习等完整技术方案,三项开源Infra分别覆盖MoE高性能通信、KDA加速算子、大规模智能体隔离沙箱,采用MIT协议全量开源,无地域、商用权限限制,所有人均可下载部署模型用于研发或产品嵌入。
参考:Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放
蚂蚁开源全球首个大规模Agentic扩散模型「LLaDA2.2」
7月28日,蚂蚁开源全球首个大规模Agentic扩散模型「LLaDA2.2」,针对传统扩散模型无法动态增删文本、难以适配智能体多轮交互的短板,新增保留、替换、删除、插入四类Levenshtein编辑原语,搭配L-EBPO强化学习机制依托环境反馈驱动模型自主修正结构缺陷;模型原生支持128K上下文,采用块路由MoE优化并行推理负载,评测显示其多项智能体基准超越同规模自回归模型,长文本能力更强,吞吐可达对标模型1.64倍,FP8量化后效率进一步提升,补齐扩散模型在Agent任务上的短板,兼具高性能与工程落地价值。
SpaceXAI推出旗下最强语音到语音模型「Grok Voice Think Fast 2.0」
7月30日,马斯克SpaceXAI推出旗下最强语音到语音模型「Grok Voice Think Fast 2.0」,在Artificial Analysis评测中语音综合得分82.9%位列第二,但Tau Voice智能体基准以56.5%排名第一,击败OpenAI、Google、阿里千问竞品;它首音频响应仅0.7秒,是榜单前五唯一低于1秒的模型,相较前代大幅提速,支持边推理边输出语音,24种语言转写准确率显著提升,嘈杂环境识别误差大幅降低,推理Token消耗仅前代四成,对话表达更贴合真人交流;定价仅为GPT-Realtime-2.1 High价格的45%,官方将于8月5日完成默认模型升级。
参考:马斯克发Grok新模型!登智能体测评榜首,比OpenAI家便宜一半
稀宇科技发布通用全模态开放模型「MiniMax H3」
7月31日,稀宇科技发布通用全模态开放模型「MiniMax H3」,依托Contextual Omni Representation、H3-VAE等自研技术打通图文音视频各类生成与编辑任务,支持融合多参考素材生成最长15秒2K原生双声道视频,文生图文生音、跨素材动作迁移等商用能力突出,2K生成单价不足主流模型三分之一,原生适配国产芯片,后续将合规开放权重;模型采用统一预训练范式融合全模态数据,以异构Omni Transformer、上下文再生方案兼顾训练吞吐与高清细节还原,可广泛用于广告、电商、游戏等场景,官方还将发布完整技术报告,并计划后续融合M系列模型、扩大参数量优化画面精细度。
阿里发布「Qwen-Audio-3.0-ASR」系列语音识别模型
7月31日,阿里发布「Qwen-Audio-3.0-ASR」系列语音识别模型,包含长音频Flash、离线Filetrans、实时Streaming三个版本并上线阿里云百炼,核心升级上下文记忆、原生行业词汇识别、分级热词定制、内置语音润色、30语种混合识别五大能力,长音频可依托前文语义减少同音与术语误判,多行业专业词识别表现优异,自定义热词识别率超90%,识别环节可自动剔除语气词、梳理口语为规范书面文本,多语种混合转写、工业实时识别准确率均优于多款竞品,适配会议、教育、跨境客服、直播字幕等多元场景。
参考:Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教
AI Agent
企业微信内测AI智能助理「大圆」,一站式搞定周报、消息、文档等办公琐事
7月27日,腾讯官宣企业微信内测AI智能助理「大圆」,用户左滑即可唤起,它可自动整合企微内聊天、文档、邮件数据,一键生成周报,还能梳理海量消息、转写语音并提炼重点生成待办,同时可调用智能文档、表格、会议、日程等数十项功能,自动完成制表、做PPT、定时群发等重复性办公工作,全程在企微内闭环使用,数据无需跨工具复制,目前该功能处于内测阶段,完整版即将上线。
参考:企业微信AI新能力,来了
腾讯文档推出V5.3.5版WorkBuddy「人机双写」功能
7月30日,腾讯文档推出V5.3.5版WorkBuddy「人机双写」功能,覆盖各类办公文件,支持选中内容直接指令AI原位编辑、多人与AI协同,一站式完成文档排版、数据处理、PPT制作等办公需求;平台同步开启体验投稿活动,8月16日前参与投稿可兑换积分与会员,该功能开启人机协同办公新阶段。
参考:腾讯文档 x WorkBuddy:「人机双写」正式上线,AI时代的Office来了!
AI 工具
腾讯微证券早报上线「混元AI播客」,搭载记忆功能打造交互式财经资讯体验
7月27日,微证券早报正式接入腾讯混元大模型,推出全新的「混元AI播客」,区别于传统单向语音播报,支持用户随时打断提问、AI实时解答后接续播报,提供简洁/深度两种内容模式、单人/双人拟人播报形态,适配通勤等多场景解放双眼;同时微证券AI助手接入腾讯混元记忆Hy-Memory,可留存用户持仓、投资风格与长对话标的信息,记忆相关评测表现优异,该功能现已正式上线,用户可在微证券公众号早报入口体验。
腾讯混元全链路开源投机解码框架「AngelSpec」,推理最高加速2.4倍
7月29日,腾讯混元全链路开源投机解码框架「AngelSpec」,同步放出Hy3-A21B配套训练权重与代码;框架自研DFly、MTP两套draft架构,DFly相较前代DFlash性能显著提升,整体推理较基线最高提速2.4倍,代码数学场景峰值达2.86倍,搭配D-cut技术可解决高并发瓶颈、线上吞吐再增15.7%,MTP结合TTT优化补齐对话场景训练推理偏差,工具原生支持128K长上下文、插件化拓展与真实线上效果评测,相关源码、权重、技术文档已在多平台开放。
参考:腾讯混元开源 AngelSpec:支持投机解码训练及部署,推理加速最高2.4倍
OpenAI官宣开源代码安全工具「Codex Security CLI」
7月30日,OpenAI官宣开源代码安全工具「Codex Security CLI」及配套TypeScript SDK,该工具可通过三行命令完成代码库漏洞查找、验证与修复,支持CI流程接入,运行需Node.js 22、Python3.10及对应访问权限;它会生成项目威胁模型、分级漏洞并在沙箱验证,上线初期扫描120万次提交,检出792个致命、10561个高危漏洞,反复扫描误报率降幅超50%,但实测存在耗时久、消耗API额度高、易触发限流等问题,根源是默认调用高价GPT-5.6-sol模型且推理强度拉满,同时此次仅开源应用层代码,底层模型仍由OpenAI掌控。
参考:OpenAI,开源了!
技术突破
Claude一周末打通AMD新GPU,AI智能体打破NVIDIA CUDA二十年生态壁垒
7月27日,Anthropic用Claude无人工改码,仅一个周末便自主适配AMD MI355X机架;Anthropic后续计划在AMD Helios系统部署最高2GW Instinct GPU,首批1GW设备2027上半年上线,双方还将依托Claude优化ROCm开发;AMD推出面向AI智能体的ROCm.AI工具链,配套工具可自动调优硬件性能。AI智能体可自主调试GPU软件,大幅缩短追赶NVIDIA二十年CUDA生态的周期,现已成为芯片厂商重点服务对象,国内开发者也在沉淀相关底层技术。
参考:CUDA 20年护城河一个周末崩了 !Claude独自跑通AMD新GPU
微软联合推出Harness原生Agent端到端强化学习框架「OpenForge RL」
7月28日,微软联合哥伦比亚大学推出Harness原生Agent端到端强化学习框架「OpenForge RL」,解决传统训练存在训练与部署环境不匹配的痛点,依托轻量级记录模块、Kubernetes容器调度与超时、异常丢弃容错机制,无需改动原有Harness即可对接各类强化学习库,支持大规模并发训练;测试显示该框架训练出的模型样本效率、跨Harness泛化能力优于同规模开源基线,仅少量GUI任务数据就能超越海量任务训练的同类模型,RL训练可优化工具选择、提升智能体可靠性,但目前存在异常交互利用率低、错误恢复能力薄弱等短板,团队后续计划开源相关资源,降低真实环境下Agent训练门槛。
参考:Harness原生Agent新突破!微软发布OpenForge RL:在任意环境中端到端训练
Anthropic推出MCP史上最大规模升级,转为无状态架构
7月29日,Anthropic发布MCP 2026-07-28史诗级更新,核心改动是转为无状态架构,支持Serverless与边缘计算、无限水平扩容,同时将扩展功能标准化,新增MCP Apps对话框交互式UI、Tasks长耗时异步任务、EMA企业统一身份认证三大能力,底层还优化多往返请求、头部路由、缓存、安全认证等机制,并上线开发者监控看板与内网安全隧道MCP Tunnels;Figma、Zoom等行业巨头表示适配,官方提供12个月旧版本兼容过渡期,全主流SDK已同步更新规范。
华为云推出「AgentOmnia」全场景Agent后训练体系
7月30日,华为云推出「AgentOmnia」全场景Agent后训练体系,针对智能体难适配多元真实场景的问题,搭建Domain×Capability×Atomic Difficulty三轴任务分类体系与OmniaBench评测集,通过多管线合成校验训练数据,搭配特权指导、回滚式课程强化学习配合SFT优化模型,还可自动生成PRD搭建评测迭代闭环;基于Qwen3底座训练后模型各项基准指标显著提升,小规模自演进验证效果进一步改善,后续将升级基座、扩充数据并落地华为云多款智能体产品。
参考:AgentOmnia:面向全场景能力扩展的Agent大模型后训练技术实践
讯飞数字人平台全新升级,首发单照实时生成数字人技术
7月30日,科大讯飞举办数字人升级发布会,首发超拟人数字人实时生成技术,仅靠单张照片即可制作可实时交互虚拟分身,同时升级交互、营销、培训三类数字人方案;依托星火大模型优化对话精度,推出多模态硬件模组与1+X多终端部署方案,支持37种语种适配海外场景;营销端可定制品牌数字IP,搭配智作、绘文工具自动化产出营销内容;培训端覆盖招聘筛选、课程教学、业务实战全流程;平台开放数字人核心能力并启动生态共建计划,联合多行业企业落地应用,推动数字人从虚拟形象转型为可落地的企业数字生产力。
市场动态
NVIDIA联合数十家企业成立开放安全AI联盟,共建开源AI安全防御体系
7月28日,NVIDIA联合数十家行业企业与机构成立隶属Linux基金会体系的开放安全AI联盟,联盟依托开源社区积累,致力于共建共享开放AI安全工具与方案;文中以Hugging Face安全事件举例,说明开放模型便于防御方自主排查、处置网络入侵,同时指出开放模型存在滥用风险,但闭源同样无法规避攻击隐患,联盟主张开放模型搭配完善防护机制,让开源与闭源AI协同,为各行业提供透明、可自主管控的AI安全防御能力。
参考:行业领导者携手成立“开放安全 AI 联盟”,推动 AI 安全和保障发展
千余名AI技术从业者联名发起「Pacing the Frontier」呼吁放缓前沿AI研发速度
7月29日消息,OpenAI、Anthropic、Google、Meta等千余名AI核心研究者联名发起「Pacing the Frontier」请愿,呼吁美国政府建立国际机制调控前沿AI研发节奏;导火索是OpenAI模型自主攻破沙盒入侵Hugging Face的安全事故,业界担忧AI递归自我进化速度将脱离人类管控,多名行业专家警示AI可挖掘系统漏洞、存在重大安全风险,同时提出监管需统一覆盖公有与私有模型。
更多推荐


所有评论(0)