KV缓存占用降到上一代的四分之一,不等于一个项目便宜了四分之三。V4.1 Flash的意义,要放进缓存命中、输出用量、失败重试和人工复核这四笔账里看。
精选热点
查看完整榜单筛选资讯 · 全部日期 · 全部主题
AI时间线
2026-09-11今日 21 条动态
在高盛Communacopia + Technology大会上,黄仁勋再次确认明年营收同比增长70%的预期,并称英伟达已深度嵌入AI生态,能“看到未来”。
GitHub官方博客介绍,GitHub Copilot应用内置diff面板、终端面板和浏览器面板,让审查、运行和预览agent生成的代码在同一应用内完成,无需在编辑器、终端和浏览器之间切换。
Runway发布研究说明,介绍其通过让基础模型因果化、自回归化再蒸馏的方式实现实时视频生成;公司称目标是优化首帧时间并流式输出视频,但未给出具体延迟或成本数字。
OpenAI产品负责人Thibault Sottiaux在X上表示,Pro套餐对系统压力最大,因此暂时关闭该档位的新用户注册;API、Go和Plus等其他套餐仍可订阅,但公司未说明暂停持续多久。
这批归档仅用于CI构建原生Windows语音版Codex,不包含在Codex用户安装包中,包含 103 个固定版本Cygwin二进制包和 83 个对应源码包。
一篇Google AI Developers的开发者文章称,“图工程”是把微服务式后端架构思路用于智能体编排:用严格schema的节点和fan-out、join、条件路由,替代让LLM在黑盒循环里自由游走,以找回可预测性和可调试性。
该版本说明(来源仅为发布页摘要)写明唯一改动是Vulkan后端使用addallocdep让topkmoe融合在预填充(prefill)阶段生效(PR #28422),同时照例提供各平台预编译包。
AWS宣布Amazon Quick桌面应用在macOS和Windows上正式可用,并为iOS和Android移动端加入整合邮件、日历、CRM和消息的活动流。
该版本将Windows ARM64 CUDA 13.4构建从Developer Preview归档迁移到 13.4.1 正式发布(GA)可再发行组件,并同步更新各平台预编译包。
该语音模型可同时听与说,在OpenAI基准测试中全双工交互得分 80.1%,前代为 45.4%;定价每分钟 0.05 美元。
该版本为Managed Agents加入自动模式工具权限、无需authorizationtoken即可挂载公开GitHub仓库,并新增webfetch的contenttoolarge错误码。
这家印度音频故事平台的联合创始人兼CEO罗涵·纳亚克称,AI让内容制作成本降低约 80 倍,过去需要一年制作的 100 小时内容现在一天即可完成;美国是其最大市场,贡献约 70% 的年化营收。
Sierra在官方博客介绍新一代多模态代理,把语音、文字和可视化组件放进同一段对话,代理自行判断何时用哪种形式,并支持一次开发、全渠道部署。
LiteLLM v1.100.1已发布,除回迁两项改动外,还撤销了stable/1.100.x上的支出归因回迁;版本说明同时提醒Docker镜像已用cosign签名。
微软ONNX Runtime发布 1.30.0 版本,这些说明覆盖自 1.29.1 以来的变更。亮点包括:CUDA推理支持扩展,为连续批处理引入变长因果卷积、paged XQA中的投机解码,以及带per-channel scales的INT4 paged KV cache;WebGPU方面改进PagedAttention、新增GPT-OSS支持与INT8 KV-cache块量化;CPU端新增AVX-512、Arm64 NEON和SVE的融合LinearAttention内核;并新增ONNX Runtime C API的Go绑定与DeepSeek Engram contrib算子。
J.S. Held《全球风险报告》数据显示,2025年供应链中断给企业造成约1840亿美元损失;FourKites与ABI Research报告称,仅27%的组织允许AI自主行动,52%仍将其限制在决策支持环节。
Vishal Maini称,2018至2022年在DeepMind传播与政策团队任职期间,"任何人在组织任何层级都不被允许对外沟通人类灭绝的可能性",研究人员被指示将这类风险斥为危言耸听。
Skild AI称S1通过上下文学习,从单段视频演示中学会此前未见的长程任务,单步成功率约 66%,对照系统为 9%;公司还称达到 1 亿美元年化营收、10 个月内建立 60 多个部署合作。
英伟达发布博客,介绍其面向Robotaxi的三计算机架构:DGX负责模型训练、Omniverse与Cosmos负责仿真验证、DRIVE Hyperion负责车载计算与传感器融合,并列出Uber、Wayve、Pony.ai、特斯拉等采用方。
OpenAI新闻页面发布的摘要显示,César de la Fuente的实验室使用Codex和ChatGPT,在现存和已灭绝生物的基因组中搜索候选抗菌分子,用于应对耐药感染。
2026-09-1071 条动态
llama.cpp新构建b10896修复了投机解码组件DFlash在搭配视觉模型时,mtmd chunk因图像固定偏移而无法解码的问题,并调整为仅跳过图像、允许音频通过。
该平台允许用户基于环球音乐授权曲库制作混音、串烧和改编版本,艺术家可自行决定是否参与,并将与ElevenLabs现有音乐工具保持独立。
Arena.ai对数万条高推理Text Arena输出分析显示,Fable 5.1相比Fable 5少用破折号、认同式开头和"honestly""frankly"等措辞,但答案更长;中位回答 414 词,比Fable 5的 319 词多 30%,仍比Opus 5的 525 词少 21%。
该论文提出压缩与泛化之间的数学联系:在八个数据集上,数百轮实验得到的策略可压缩为16至32个token的提示,让无记忆的新代理复现结果;而故意过拟合时,性能优势无法通过压缩瓶颈。
英伟达技术博客介绍BioIR的端到端结构预测流程,支持串行与Ray两种执行后端;在 8 张H100上的 1000 个人类二聚体基准中,其残基归一化折叠吞吐量为开源实现的 2.90 倍,开源版有 29 个目标因显存不足失败。
研究者Chris Schmitz在 11 个司法辖区追踪到 84 起“agentic flooding”案例,投诉和申请量多在 2022 年后加速上升,且尚未放缓。
在9月的Decoder听众来信特辑中,主持人Nilay Patel回应了听众对“软件大脑”与“人们并不渴望自动化”的批评,重申AI的可验证性在软件之外会迅速失效,并解释为什么自然语言无法成为通用界面。
llama.cpp发布构建b10894,本次唯一代码变更是清理若干旧模型中因早前重构而被复制粘贴、实际上已不可能触发的switch分支。