
Heurist Finance将多种机构级投研流程整合进单一聊天体验,利用AgentCore支付、身份、内存、代码解释器和可观测性,实现按查询购买溢价数据、沙箱分析和完整审计跟踪。
阅读全文从新闻再向前一步,读懂技术背景与产业影响。

Heurist Finance将多种机构级投研流程整合进单一聊天体验,利用AgentCore支付、身份、内存、代码解释器和可观测性,实现按查询购买溢价数据、沙箱分析和完整审计跟踪。
阅读全文智能模型路由通过在请求级别选择最合适的模型,可将LLM成本降低约 10 倍,同时保持响应质量。该策略依赖请求的复杂性分布、模型间的价格差异以及路由系统的准确性。
阅读全文MIT研究员使用GPT-5.6 Sol与Codex自主运行量子计算实验、分析结果并校准量子比特。
阅读全文HPE Zerto与AWS合作,在Zerto产品内嵌入由Amazon Bedrock驱动的智能体故障排查系统,运行于客户本地环境,超过 20% 的客户已采用。

滴滴国际业务集团与AWS合作,用Amazon Bedrock替换了不透明的第三方客服质检方案,覆盖西班牙语和葡萄牙语、出行/外卖/金融三条业务线。生产验证中,意图识别准确率从38%升至86%,合规评分准确率超过90%,人工摘要从数小时缩至数分钟。

ByteByteGo最新指南指出,LLM应用与传统软件不同,需同时处理技术故障和语义故障(如幻觉、错误JSON),并通过重试、超时、熔断、幂等等技术增强弹性。

据《纽约时报》报道,鼎盛时期内罗毕至少有 4 万人靠为美英大学生代写论文为生;ChatGPT发布后订单与价格崩塌,残留工作只剩“去AI化”改写。
在GPT-6 Astra评分引发质疑后,Artificial Analysis发布Intelligence Index v4.2,将Astra的得分调整为高于前代模型 4 分,同时加入AA-Briefcase和GDP.pdf两项新基准。

从甜甜圈虾到混凝土冰淇淋,AI生成的食品图片常常令人倒胃口。专家解释了背后的技术原因、训练数据问题以及人类心理因素。

Anthropic的Claude Fable 5.1领跑指数,OpenAI的GPT-6 Astra紧随其后;新增评测覆盖多周知识工作项目与4592页长文档推理,私有测试集权重翻倍以防止刷分。

Genie Agents现支持多步推理的Agent模式及API、分析Unity Catalog卷中的非结构化文件,并推出Genie Code帮助数据专家更快构建和优化代理。

ByteByteGo技术博客指出,RAG聊天机器人的回答准确率取决于嵌入模型而非语言模型;检索失败无法靠更强的大模型修复,更换嵌入模型需重嵌整个文档库。

Miro一支 11 人品牌团队用Runway生成Canvas26大会开场视频的全部镜头,并针对四个活动城市分别做了本地化版本。

Google的科学家介绍AI天气模型如何处理气旋路径与强度信息,目标是让受影响社区更早获得预警。

ByteByteGo发布技术图解指南,介绍通过量化、剪枝和知识蒸馏三种技术,在不显著损失智能的情况下压缩大语言模型,使其能在消费级硬件上运行。

Anthropic新旗舰模型在最大推理强度下得 66 分,超越Claude Opus 5、Fable 5与GPT-5.6 Sol;缓存读取价格下调 75%,但仍因输出token用量约 1.7 倍于Fable 5而推高单任务成本。

Julia编程语言如今拥有全球数百万用户,被用于前沿研究、新药设计、喷气发动机和热泵开发等多个领域。
该工作流基于COMPASS框架,利用AI智能体自动化训练流程,减少为每种机器人-场景组合重复开发的开销。

MATS Research等机构在2026年8月证明,AI提供商发回客户的加密推理块可被同系列更便宜模型以明文形式转录,泄露了API密钥、密码等敏感数据。

Sonar CTO Andrea Malagodi与Google DORA、METR等研究均显示:AI让写代码变快,但验证负担大增,现有静态分析、测试、人工审查组成的“过滤器栈”正面临数量与安全漏洞双重压力。

合作将先在离线沙盒环境中测试AI,再逐步推进至EVE Frontier等开放世界;同时已上线基于Gemini的Aura Guidance新手引导系统。
LangChain本周发布Managed Deep Agents,面向开发者的托管Agent构建服务,将Deep Agents harness与LangSmith的运行时、沙箱、评估、认证等基础设施捆绑在一起。

LangChain在 145 个智能体任务上评测了英伟达开源路由库NeMo Switchyard。结果显示,仅 7% 的调用真正需要前沿模型,路由使总成本降低 74%,但准确率下降 6 个百分点。

亚马逊宣布向Lean Focused Research Organization提供大额长期资助,称其为该组织史上最大单笔捐赠。Lean正被用于验证AI智能体策略、差分隐私保护与芯片编译器的正确性。
文件整合了AI技术发展、受影响岗位和生产率早期数据,并指出仍需研究的不确定点。
