开放申请截止 9 月 21 日,入选者将获直接资助、模型访问权限与技术支持,研究成果将以开源形式发布。
阅读全文模型发布
追踪模型的新能力,理解每一次迭代带来的变化。
DeepSeek发布V4-Flash-Vision-Exp多模态实验模型,API已上线
DeepSeek-V4-Flash-Vision-Exp在文本能力上与V4-Flash持平,多模态智能体性能接近Opus-4.8,每张图像按最多384个token计费。
阅读全文Thinking Machines发布首款从零训练模型Inkling:9750 亿参数、百万上下文、Apache 2.0开源
Inkling采用 256 专家混合架构,每次仅激活 6 个路由专家和 2 个共享专家;模型权重以Apache 2.0协议发布在Hugging Face上。
阅读全文Anthropic:未来Claude模型将内置文本水印,符合欧盟AI法案
Anthropic宣布未来Claude模型生成的文本将包含水印,用于判断文本是否由Claude生成,且不影响输出质量。
谷歌发布Gemini 3.7 Flash模型
据谷歌DeepMind官方博客,Gemini 3.7 Flash已发布,但具体性能、可用性及技术细节尚未在摘要中透露。
DeepSeek发布V4-Pro:强化Agent能力,支持OpenAI Responses API,并推出峰谷定价
DeepSeek于2026年8月13日发布V4-Pro,主打Agent工作流优化,支持原生OpenAI Responses API,并宣布自8月16日起实行峰谷API定价,低谷时段价格降低50%。

谷歌发布手语转文本模型SL2T,率先落地Pixel 11的Gboard与Live Transcribe
该模型支持超过50种手语的训练数据,首期开放美国手语(ASL)转英语功能,仅将身体姿态坐标发送至服务器以保护隐私。
Google DeepMind发布Gemini Robotics ER 2,提升机器人视频理解与多机协作能力
该模型据称在视频理解、工具编排和多机器人协作方面实现“阶跃式”进展,旨在帮助机器人推理、协作并解决真实世界任务。
Google DeepMind发布Lyria 3.5,集成于Flow Music,提升音乐性、歌词、人声与创意控制
Lyria 3.5是Google DeepMind的音乐生成模型,现已在Google Flow Music中推出,官方称其在音乐性、歌词质量、人声表现和创意控制方面均有进步。
Google DeepMind发布Gemini Robotics 2,实现机器人全身控制与多机协作
新模型系列Gemini Robotics 2支持人形机器人全身协调操作、精细灵巧操作以及多机器人协作,其中推理模型已上线AI Studio。
Google DeepMind推出Gemini 3.6 Flash、3.5 Flash-Lite与3.5 Flash Cyber三款新模型
Google DeepMind披露信息仅确认三款新模型已发布,未提供性能、价格或开放范围细节。
谷歌推出Gemini 3.5 Flash Cyber轻量网络安全模型
该模型基于Gemini 3.5 Flash微调,用于快速发现、验证和修复软件漏洞,初期仅向政府和可信合作伙伴限量开放。
谷歌发布Nano Banana 2 Lite与Gemini Omni Flash,开放开发者预览
DeepMind推出轻量级图像生成模型Nano Banana 2 Lite及多模态模型Gemini Omni Flash,均面向开发者开放。
Google DeepMind推出Gemini 3.5 Flash的“计算机使用”能力
新的Gemini 3.5 Flash模型能够理解屏幕并执行操作,为AI智能体控制计算机铺平道路。
Google DeepMind发布DiffusionGemma实验模型:GPU文本生成速度提升最高 4 倍
该 26B MoE模型采用文本扩散技术,在消费级GPU上实现超过 700 tokens/秒的生成速度,但输出质量低于自回归Gemma 4。

谷歌推出Gemini Omni Flash:可对话编辑视频的多模态生成模型
该模型支持以视频、图像、文本、音频为输入生成高质量视频,并允许通过自然语言指令逐步修改场景、动作和风格。即日起面向Gemini付费用户及YouTube Shorts开放。

百度发布文心 5.1:参数压缩至 5.0 的约 1/3,预训练成本约为同规模模型的 6%
百度称文心 5.1 在Arena搜索榜获国内第一、全球第四,Agent能力超越DeepSeek-V4-Pro,推理得分接近Gemini 3.1 Pro。

百度发布文心大模型5.1 Preview,登顶LMArena文本榜国内第一
百度ERNIE-5.1-Preview在LMArena文本榜排名国内第一、全球第十三,参数压缩至原版约1/3,预训练成本仅为同规模模型的6%。
百度发布ERNIE-Image文生图模型,基于 8B DiT架构
百度ERNIE官方博客宣布推出ERNIE-Image,一款基于 8B DiT参数的单流扩散Transformer文生图模型,官方称其在多项基准测试中达到开源模型领先水平。
百度发布文心5.0:2.4万亿参数原生全模态大模型,文本图像音频视频联合建模
该模型采用统一自回归网络与“下一组Token预测”任务,将文本、图像、音频和视频映射至共享符号空间,实现跨模态理解与生成的端到端优化。

百度发布PaddleOCR-VL-1.5:0.9B模型在OmniDocBench v1.5上达 94.5% 准确率
新版模型新增印章识别与文本检测识别一体化能力,并推出Real5-OmniDocBench基准,用于评测扫描、弯折、屏幕拍照等真实场景下的鲁棒性。

百度ERNIE-5.0-0110登顶LMArena文本榜国内第一,全球第八
百度官方 1 月 15 日称,ERNIE-5.0-0110以 1460 分位列文本榜国内第一、全球第八,数学榜全球第二;该版本已不再标注“Preview”。

百度ERNIE-5.0-Preview-1203登顶LMArena中国文本模型榜,总分1451
百度称其ERNIE-5.0-Preview-1203在LMArena最新榜单中以1451分位居中国文本模型首位,开发者即日起可申请体验。

百度发布文心大模型ERNIE-5.0-Preview-1103,称登顶LMArena文本榜单前 20
百度ERNIE团队发布新版文心大模型,在对抗性文本竞技场Text Arena中排名前 20,软件与IT领域得分与GPT-5.1-high持平。

百度ERNIE-5.0预览版登顶LMArena视觉榜,文本版位列全球第二
ERNIE-5.0-Preview-1120在LMArena Vision Arena创下1206分纪录,排名国内第一;ERNIE-5.0-Preview-1022在文本榜位列全球第二。
