
Google AI开发者Jan-Felix Schmakeit在技术博客中分享四项经验,主张将评分量表视为形式化规范,通过原子化、客观化问题降低LLM评判者的主观歧义,并建议与人类专家校准。
阅读全文从新功能到新体验,发现 AI 正在怎样进入日常。

Google AI开发者Jan-Felix Schmakeit在技术博客中分享四项经验,主张将评分量表视为形式化规范,通过原子化、客观化问题降低LLM评判者的主观歧义,并建议与人类专家校准。
阅读全文文章讨论如何选择草稿长度和草稿机制,在不牺牲准确率的前提下平衡大模型吞吐量与交互延迟。
阅读全文该计划以有限访问方式开放Google的网络防御工具,参与对象限定为政府机构和受信任合作伙伴。
阅读全文ByteByteGo技术博客指出,RAG聊天机器人的回答准确率取决于嵌入模型而非语言模型;检索失败无法靠更强的大模型修复,更换嵌入模型需重嵌整个文档库。

Google AI开发者发文介绍harness engineering概念,指通过沙箱、修复循环等确定性组件限制AI编码代理行为,并引用OpenAI实验称 3 名工程师用Codex构建了零手写代码的内部测试产品。
该系统将神经网络内部计算转化为人类可读的概念,如“接近停驻车辆”或“靠近骑行者”,并在拉斯维加斯公开道路完成实车测试,性能损失小于1%。

Runway推出托管MCP服务器,连接其Dev API平台与编码工具,代理可研究模型、配置路由并调试失败调用。

双方计划把合作扩展到Gemini和Google Health,用AI支持大型创意项目及相关内容制作。

诺基亚核心网络部门用Cursor在两周内完成对超 5000 万行代码的分析,且仅需两名工程师,省下了原本需十几名专家数月才能完成的工作。

Cursor发布Self-Hosted Machines功能:开发者可将云代理的执行环境迁移至自己管理的机器池或AWS Lambda、Cloudflare等沙箱提供商,代理循环与推理仍在Cursor云端进行。

OpenAI的客户案例称,这家巡演团队把ChatGPT用于营销、商品管理和内部工具制作。
微软认为,AI投资不应只看芯片、token和数据中心规模,还要衡量系统最终产生多少可用智能与实际成果。
Paint.NET作者Rick Brewster表示,由于Direct2D在WINE上永远无法完整支持,他借助AI(Claude)从头逆向重写了约 18 万行代码,通过 /wine参数启用,代码未充分审查,属于“vibe coding”产物。
该电子书从架构、部署、评估到干系人管理,覆盖六大章节,旨在帮助企业将AI代理从试点推进到可靠的生产系统。

该功能预计今年晚些时候上线,将覆盖导航、菜单和工作流工具,面向沙特及更广泛的阿拉伯语创作者。

智谱新旗舰模型GLM-5.3已通过硅基流动提供Serverless API,模型ID为zai-org/GLM-5.3,支持工具调用、流式输出和结构化输出。

Cursor更新支持将agent工具执行放在客户自有网络中,并新增团队worker队列、云沙盒集成及Linux/macOS电脑操作功能。

FDA采用Databricks for Government平台,通过Unity Catalog实现数据治理,AI用例已在生产中应用,并计划到 2028 年用户超 1 万。

在Fal.Con 2026上,NVIDIA CEO黄仁勋与CrowdStrike CEO George Kurtz联合发布SafeMind,该系统整合双方模型,在持续攻防对抗中强化安全防护。

Sierra博客发文区分语音AI与AI语音代理,强调企业级评估需覆盖听清、理解、行动、恢复与转接全流程,并提出七项测试。

谷歌在2026年8月发布Gemini 3.7 Flash、3.5 Transcribe及Pixel 11系列,Gemini应用月活超10亿。

Databricks工程师发现Agent在工具调用失败后不会大声报错,而是静默重试,浪费token和等待时间。借助Unity Gateway的追踪数据和Genie One的自然语言查询,他们在约一小时内找到七个工具服务器Bug,每年可节省约49.9万美元token成本和1.2万工程小时。

AWS同步提供Claude Platform,并介绍面向高能力模型的数据保留、安全审查和访问控制措施。

开发者Simon Willison发现,OpenAI Codex桌面应用(现更名为ChatGPT)在其缓存目录中打包了完整的Python、Node.js安装及LibreOffice等原生二进制文件,总占用约 1.7GB。
Simon Willison发布GeoJSON Map Viewer,可在OpenStreetMap上交互式查看GeoJSON数据,并支持自定义填充样式、导出PNG。工具由GPT-5.6-Sol生成,经Claude Code与Fable 5.1迭代完善。

Miro一支 11 人品牌团队用Runway生成Canvas26大会开场视频的全部镜头,并针对四个活动城市分别做了本地化版本。

在Simon Willison网站发布的引言中,《矮人要塞》联合创作者Tarn Adams表示,他们不再使用“AI”一词来描述游戏中的矮人行为,并强调该功能并非真正的AI。
方案试图让安全系统主动寻找现有告警和预设流程没有覆盖的防御缺口,再把发现转成调查任务。

OpenAI汇总Basis、Clay和Exa Labs的实践,讨论企业如何把智能体从试验工具变成日常运营能力。
Google发布《Elevating Antigravity Agent Skills》系列第二部分,详解如何在agent skill中使用generate_image工具,结合结构化提示词生成符合开发规范的商品图,并指出三条避免视觉资产混乱的反模式。
