
VOIDZ的新片《Ends Meat》时长约 95 秒,包含 15 处超现实干预,素材来自一次未经脚本的超市购物。他称若用传统 3D和VFX独自完成,可能需要六到十二个月。
阅读全文从新闻再向前一步,读懂技术背景与产业影响。

VOIDZ的新片《Ends Meat》时长约 95 秒,包含 15 处超现实干预,素材来自一次未经脚本的超市购物。他称若用传统 3D和VFX独自完成,可能需要六到十二个月。
阅读全文Anthropic发布威胁情报报告,记录2025年12月至2026年8月间Claude的滥用情况:俄罗斯语攻击者靠AI代理自动改写恶意软件,也门小组用Claude Code开发射程超2000公里的导弹制导软件,中国七家实验室通过虚假账户获取训练数据,阿里Qwen单次活动超1.51亿次交互。
阅读全文英伟达技术博客给出的一组基准数据:在 4xB200、64K输入、76% KV复用、每用户 50 TPS的agentic负载下,开启NIM 2.0.12优化后系统吞吐从 718 tok/s升到 1997 tok/s,官方称这意味着同等交互性下可服务 2.5 倍以上并发用户。
阅读全文OpenAI新闻页面发布的摘要显示,César de la Fuente的实验室使用Codex和ChatGPT,在现存和已灭绝生物的基因组中搜索候选抗菌分子,用于应对耐药感染。
AvioBook在AWS上用一周时间搭出多智能体概念验证:把AvioBook Connect里每架航班的聊天记录和事件日志,变成航空公司经理和签派员能用自然语言提问并拿到证据的答案,还能顺带检查延误代码填得对不对。

该论文提出压缩与泛化之间的数学联系:在八个数据集上,数百轮实验得到的策略可压缩为16至32个token的提示,让无记忆的新代理复现结果;而故意过拟合时,性能优势无法通过压缩瓶颈。

在9月的Decoder听众来信特辑中,主持人Nilay Patel回应了听众对“软件大脑”与“人们并不渴望自动化”的批评,重申AI的可验证性在软件之外会迅速失效,并解释为什么自然语言无法成为通用界面。

钛动科技在ECCV 2026牵头举办Agentic Commerce方向Workshop,配套挑战赛以 3108 支广告视频构建数据集,64 支团队提交超过 1060 份方案。赛道间最高分差距明显:视频整体理解 86.67 分,关键时刻定位 62.27 分,营销意图推理 63.53 分。
Credit Genie的AI与ML工程团队把LangChain开源仓库文档代理OpenWiki接入开发流程,文档存放在各仓库的openwiki/文件夹,每天夜间检查提交差异并自动提交PR,再由自动批准合并任务消除人工瓶颈。团队称早期收益包括跨仓库上下文获取更快、减少“部落知识”,并让编码代理在改代码前先读openwiki/文件夹。

Heurist Finance将多种机构级投研流程整合进单一聊天体验,利用AgentCore支付、身份、内存、代码解释器和可观测性,实现按查询购买溢价数据、沙箱分析和完整审计跟踪。

智能模型路由通过在请求级别选择最合适的模型,可将LLM成本降低约 10 倍,同时保持响应质量。该策略依赖请求的复杂性分布、模型间的价格差异以及路由系统的准确性。

MIT研究员使用GPT-5.6 Sol与Codex自主运行量子计算实验、分析结果并校准量子比特。
HPE Zerto与AWS合作,在Zerto产品内嵌入由Amazon Bedrock驱动的智能体故障排查系统,运行于客户本地环境,超过 20% 的客户已采用。

滴滴国际业务集团与AWS合作,用Amazon Bedrock替换了不透明的第三方客服质检方案,覆盖西班牙语和葡萄牙语、出行/外卖/金融三条业务线。生产验证中,意图识别准确率从38%升至86%,合规评分准确率超过90%,人工摘要从数小时缩至数分钟。

ByteByteGo最新指南指出,LLM应用与传统软件不同,需同时处理技术故障和语义故障(如幻觉、错误JSON),并通过重试、超时、熔断、幂等等技术增强弹性。

据《纽约时报》报道,鼎盛时期内罗毕至少有 4 万人靠为美英大学生代写论文为生;ChatGPT发布后订单与价格崩塌,残留工作只剩“去AI化”改写。
Terminal-Bench升级到v4、AutomationBench-AA以 5% 权重取代 𝜏³-Banking,四个类别(Agents、Coding、General、Scientific Reasoning)权重维持 30%、20%、30%、20% 不变,私有测试集占比从v4.2的 40% 提高到 45%。

在GPT-6 Astra评分引发质疑后,Artificial Analysis发布Intelligence Index v4.2,将Astra的得分调整为高于前代模型 4 分,同时加入AA-Briefcase和GDP.pdf两项新基准。

从甜甜圈虾到混凝土冰淇淋,AI生成的食品图片常常令人倒胃口。专家解释了背后的技术原因、训练数据问题以及人类心理因素。

Anthropic的Claude Fable 5.1领跑指数,OpenAI的GPT-6 Astra紧随其后;新增评测覆盖多周知识工作项目与4592页长文档推理,私有测试集权重翻倍以防止刷分。

Genie Agents现支持多步推理的Agent模式及API、分析Unity Catalog卷中的非结构化文件,并推出Genie Code帮助数据专家更快构建和优化代理。

ByteByteGo技术博客指出,RAG聊天机器人的回答准确率取决于嵌入模型而非语言模型;检索失败无法靠更强的大模型修复,更换嵌入模型需重嵌整个文档库。

Miro一支 11 人品牌团队用Runway生成Canvas26大会开场视频的全部镜头,并针对四个活动城市分别做了本地化版本。

Google的科学家介绍AI天气模型如何处理气旋路径与强度信息,目标是让受影响社区更早获得预警。

ByteByteGo发布技术图解指南,介绍通过量化、剪枝和知识蒸馏三种技术,在不显著损失智能的情况下压缩大语言模型,使其能在消费级硬件上运行。

Anthropic新旗舰模型在最大推理强度下得 66 分,超越Claude Opus 5、Fable 5与GPT-5.6 Sol;缓存读取价格下调 75%,但仍因输出token用量约 1.7 倍于Fable 5而推高单任务成本。

Julia编程语言如今拥有全球数百万用户,被用于前沿研究、新药设计、喷气发动机和热泵开发等多个领域。
该工作流基于COMPASS框架,利用AI智能体自动化训练流程,减少为每种机器人-场景组合重复开发的开销。

MATS Research等机构在2026年8月证明,AI提供商发回客户的加密推理块可被同系列更便宜模型以明文形式转录,泄露了API密钥、密码等敏感数据。

Sonar CTO Andrea Malagodi与Google DORA、METR等研究均显示:AI让写代码变快,但验证负担大增,现有静态分析、测试、人工审查组成的“过滤器栈”正面临数量与安全漏洞双重压力。
