ResNet与YOLO v1共同摘得时间检验奖
最近一周AI科技圈又发生了啥新鲜事?
ChatGPT推出全新“梦境”记忆系统,个性化能力大幅提升
OpenAI为ChatGPT上线了基于Dreaming技术的新记忆系统,能自动从长期对话中整理用户偏好、项目、旅行计划等信息,并判断哪些仍然有效、哪些已过时。内部测试显示,新系统在事实回忆测试中的任务成功率从2024年的41.5%提升至82.8%,偏好遵循成功率从31.4%升至71.3%,而随时间保持信息正确的成功率提升最为明显,从9.4%跃升至75.1%。用户现可通过新增的“记忆摘要”页面查看和管理这些信息
https://mp.weixin.qq.com/s/TfQfVGg0VcA5kenObLk32g
Kimi Work Beta版发布
月之暗面推出面向知识工作者的通用型本地Agent——Kimi Work Beta版,该产品基于Kimi Code的内核能力,将AI应用从编程场景扩展至日常办公。其内置的Agent集群可根据任务复杂度自主创建多达300个子Agent并行协作,支持长达13小时的长程任务执行。在开发过程中,Kimi工程师借助AI工具一周内完成了Mac和Windows客户端,累计产出超5万行有效代码,其中92%由AI自主生成。用户现可通过自然语言指令,让Kimi Work完成本地文件处理、浏览器操作、数据分析及报告生成等复杂工作流

https://mp.weixin.qq.com/s/guE7g4kpu_PdrDT0a7DhzA
OpenAI发布Codex三项更新
OpenAI为AI编程智能体Codex新增智能体插件、注释修改和文档一键生成交互式站点三大功能,其中智能体插件为企业打包了数据分析、创意制作、销售等六个专属岗位的技能包,覆盖62个热门应用和110项技能。目前Codex周活跃用户已达500万,较年初增长8倍,其中分析师、营销人员等非开发人员占比20%,其增长速度是开发人员的3倍多。OpenAI计划将Codex引入ChatGPT,面向超过9亿周活跃用户开放,并宣布所有前沿模型和Codex现已支持在AWS平台一键部署。OpenAI联合创始人奥特曼透露,企业业务已占OpenAI收入的40%,AI产业接下来的重点是全天候自主运行的主动式AI,这也是他眼中未来一年最值得提前布局的方向

https://mp.weixin.qq.com/s/3nHDmHMYRCmuEuziq2P_oA
何恺明ResNet与YOLO v1共同摘得CVPR 2026时间检验奖
CVPR 2026公布了年度获奖论文,何恺明等人提出的ResNet与Joseph Redmon等人提出的YOLO v1共同荣获Longuet-Higgins时间检验奖,以表彰它们在十年前的CVPR 2016上发表并对领域产生深远影响。ResNet论文当前被引量已超过32万,YOLO v1论文被引量接近8万次。此外,谷歌DeepMind的D4RT研究夺得最佳论文奖,Meta的SAM 3D与英伟达的NitroGen获得最佳论文提名,清华与微软团队的研究获最佳学生论文,ChordEdit获学生论文提名

https://mp.weixin.qq.com/s/KieRMknWe2ZJx2BNw_0BmA
微软AI发布七款MAI新模型
微软AI全新推出包含图像、语音、转录、代码与推理的七款MAI系列模型,其中旗舰推理模型MAI-Thinking-1在关键软件工程基准上比肩领先模型,MAI-Image-2.5的Arena评分超越Nano Banana Pro,而MAI Transcribe-1.5则以五倍于竞品的速度实现了全球最高的转录准确率,并支持43种语言的专用术语。更重要的是,微软推出了“前沿微调”方法——通过专属的强化学习环境,让AI直接基于企业真实工作流程的数据和步骤进行学习与适应。例如,一个为Excel微调的MAI模型在匹敌GPT 5.4性能的同时,效率提升了最高10倍;而为某头部组织微调的模型,在成本降低约10倍的基础上取得了所有测试模型中的最高胜率。此外,微软还与梅奥诊所合作,将结合梅奥的临床数据与微软的AI能力,共同打造一个专注于临床推理与医疗用例的专属前沿模型,该模型将由梅奥诊所完全所有
https://microsoft.ai/news/building-a-hillclimbing-machine-launching-seven-new-mai-models/
字节开源统一框架Bernini
视频生成与编辑框架Bernini采用“先理解再生成”的核心理念,利用多模态大模型规划器进行语义理解与规划,再交由Diffusion Transformer完成视觉渲染。在可控编辑上,它能通过一条指令改变天气、季节、材质和风格,并保持帧间一致性,还能调整视角、焦点和主体动作。此外,Bernini支持以图片和视频作为编辑参考,实现主体、材质、风格的精准迁移,以及将图像或视频精准植入动态屏幕区域。在参考生成方面,能基于单张或多张参考图生成新视频,并可组合多个不同来源的元素创建统一角色,或通过多角度参考图保持物体在不同视角下的一致性,甚至能将场景关键帧扩展为连续镜头。在字节自建的评测中,这一开源框架已站进主流闭源模型的第一梯队

https://github.com/bytedance/Bernini
Qwen3.7-Plus:一体化多模态智能体基座来了
阿里正式发布Qwen3.7-Plus多模态模型,它在纯文本与视觉能力上均实现系统性升级,将“看、想、写、做、验”整合进统一智能体流程。在权威榜单Vision Arena中,该模型帮助阿里跻身全球前五、中国第一。测试显示,它在高难度视觉推理、屏幕与GUI操作、视觉到代码生成等方向均有显著提升;在长达11小时的Agent自主开发测试中,模型全自动完成了一款单词学习APP,累计生成超10,000行代码并触发超1,000次调用。同时,它能从图像或视频生成SVG、网页,能作为浏览器助手完成云服务器选购与扩容等真实操作,并可结合搜索回答需要外部知识的视觉问题

https://qwen.ai/blog?id=qwen3.7-plus
ChatExcel Max 2.0全新升级
北大团队的ChatExcel Max迎来2.0版本,核心升级在于彻底解除了文件大小、数量及工作表数量限制,能稳定处理数万行、多文件联动的业务数据。深度兼容Excel全生态,可100%留存原表的公式、动态数组、嵌套函数乃至VBA宏等逻辑。在实际应用中,它可自动跨表核对银行流水并标记异常,计算各部门工资的多项统计值;也能跨表分析团队利用率、追踪月度环比趋势并生成人力诊断报告。输出方面,能将同一份数据同步转化为带数据透视图的Excel、符合公文格式的Word、可二次编辑的PPT、可视化仪表盘、脑图和HTML文件等多种专业形态。此外,企业版支持数据存储在自有服务器,保障安全
https://mp.weixin.qq.com/s/CzIEA6UQe7NMSm9lnY73kA
扣子 3.0 正式上线
扣子 3.0 在手机端、电脑端和网页端三端全量更新,核心升级在于让人与 Agent 像团队一样协作。可以创建项目空间,在其中调度多个云端 Agent(支持扣子原生、OpenClaw、Claude Code 等主流框架)或接入本地 Agent,并邀请团队成员共同围绕一个目标分工推进任务。新版本打通了扣子编程能力,支持多人协作开发网页、App 或小程序,视频项目则搭载 Seedance 2.0 实现从剧本到成片再到剪映工程文件的对话式创作。此外,技能商店提供如 A 股投资分析、全能法务助理等专家级技能包与权威数据集,而桌面端安装后,Agent 可读取本地文件,甚至支持手机端远程调度电脑端处理文件
https://mp.weixin.qq.com/s/Pn4N5KdIKUmIpXv7Dl3aSA
MiniMax M3开源
MiniMax M3成为国内首个且唯一同时具备前沿编码能力、1M超长上下文和原生多模态能力的开源模型。在SWE-Bench Pro上,M3得分59.0%,超过GPT-5.5和Gemini 3.1 Pro;在SVG-Bench和OmniDocBench上也分别超越Opus 4.7与Gemini 3.1 Pro。它采用全新的MSA稀疏注意力架构,在1M上下文下每token计算量仅为上代模型的1/20,prefill阶段加速超9倍。实际任务中,M3能自主复现ICLR获奖论文、在24小时内将FP8矩阵乘kernel的硬件峰值利用率从7.6%提升至71.3%,并在12小时内自主完成四个基础模型的训练迭代流程。同步更新的MiniMax Code Agent产品具备Computer Use能力

https://mp.weixin.qq.com/s/JbjyiXI0kP2Wlqbd-q0www
小米开源可控视频音效生成模型ControlFoley
ControlFoley模型是一个统一的可控视频音效生成框架,支持文本引导配音、文本控制配音以及参考音频控制配音三类任务,在多个公开评测集上达到开源SOTA表现。针对文本控制弱的痛点,ControlFoley通过联合视觉编码技术,即使在文本与画面内容冲突时,也能让模型减少对视觉语义的依赖并遵循文本意图,同时保持音画同步;针对参考音频控制难题,其采用时间-音色解耦策略,抑制参考音频中的冗余时间信息,让模型能迁移参考音色而不打乱视频动作节奏。在VGGSound-Test等常规配音任务上,ControlFoley的语义对齐、时间同步和声音质量均取得领先;在文本-视觉冲突场景下,其控制能力与同步稳定性均优于现有开源方案;在参考音频控制任务上,其音色相似度、时间同步和声音质量也全面领先,甚至超过了专门在同域数据上训练的模型。代码、权重、技术报告及在线Demo均已开放

https://github.com/xiaomi-research/controlfoley
阿里通义推出通用具身智能统一动作框架 Qwen-VLA
Qwen-VLA以Qwen3.5-4B为底座并搭配DiT动作解码器,将操作、导航与轨迹预测统一为“条件动作预测问题”。通过本体感知提示,将硬件差异转化为一段结构化文本,让同一个模型能适配机械臂、移动底座等11种平台。在多项基准测试中,这个通用模型不仅超越了最佳专用模型,例如在5个仿真基准中的3个表现更优,还在真实世界的分布外场景中达到了76.9%的平均成功率,并能在零样本条件下操作运动物体

https://github.com/QwenLM/Qwen-VLA
更多推荐


所有评论(0)