中国电信TeleAgent进入IDC企业级通用Agent评估前三,用户规模接近 120 万
IDC首份《中国企业级通用Agent产品技术评估》用近百道非公开任务考察端到端完成能力,TeleAgent常规任务得分 3.49、复杂任务 3.36,任务表现满分、成本效率最高;该产品 7 月才发布V1.0。
AI解读:中国电信的通用Agent产品TeleAgent在IDC首份《中国企业级通用Agent产品技术评估》中进入国内前三,常规任务得分 3.49 分、复杂任务 3.36 分,九项能力中任务表现拿到 5 分满分,成本效率是此次测评最高分。这条新闻的信号不在排名本身,而在于一家央企产品用两个月时间把用户做到接近 120 万。
IDC这次没有沿用常见的大模型Benchmark,而是设计了近百道非公开任务,覆盖邮件、日程、文档处理,以及长上下文、多步骤循环、复杂PPT、表格处理和浏览器操作;任务跑完还会核验系统状态和最终文件。考的是Agent能不能真把事情办完,而不是模型单点能力有多高。
TeleAgent几个高分项对应的是模型外围的工程系统:上下文管理让长任务不断线,模型路由把翻译、总结等简单请求分给轻量模型以降低约 40% 推理成本,安全和权限控制让企业敢把系统交给Agent操作。对打算把Agent接入内部系统的企业来说,这些条件比跑分更接近采购决策的实际考量。
目前公开信息只支持这是一份IDC评估结果和一组产品参数,没有第三方复现或长期使用效果数据。企业是否采用仍需结合自身业务系统、权限环境和安全要求判断,普通用户暂时不需要因为这份榜单改变什么。
IDC发布国内首份《中国企业级通用Agent产品技术评估》,中国电信的TeleAgent进入前三。据量子位报道,TeleAgent常规任务得分 3.49 分、复杂任务得分 3.36 分;九项能力中任务表现拿到 5 分满分,成本效率为此次测评最高分。
IDC这次没有沿用常见的大模型Benchmark,而是设计了近百道非公开任务,考察Agent在真实办公环境里能否把任务完成。任务类型包括邮件、日程、文档处理等日常办公,以及长上下文、多步骤循环、复杂PPT、表格处理和浏览器操作等复杂场景。
据量子位报道,部分题目接近真实工作,例如处理 3755 行脏数据,或从约 3 万字材料中提炼内容并生成 11 页PPT。任务执行完成后,IDC还会核验系统状态和最终文件,确认Agent是否真的完成任务。
TeleAgent的时间线是:2026 年 4 月桌面端在公司内部试用,7 月V1.0正式对外推出。据量子位报道,正式推出一个多月后,用户规模已接近 120 万。
IDC考了什么:近百道非公开任务,核验最终文件
IDC对企业级通用Agent的定义是:能够理解目标、调用工具和Skill、连接企业知识和业务系统,并持续执行任务。
据量子位报道,测试结果显示大多数通用Agent已能把复杂任务跑起来,但任务变长、步骤变多后,交付质量和资源消耗的差距会同步放大。TeleAgent在这套考法下任务表现拿到满分,成本效率为此次评测最高。
支撑高分的是模型外围的工程系统
IDC报告提到Agent Harness概念,指围绕大模型搭起来的一整套执行系统:安排上下文、调度工具、保存任务状态、控制执行环境,遇到异常时判断重试、换路径还是恢复进度,结果生成后检查任务是否完成。
上下文方面,TeleAgent做了一套分级处理:先对价值较低的旧工具输出做轻量剪枝,上下文仍然过长时再由专门的压缩模型处理整段内容;系统实时监测上下文是否接近上限,触发窗口限制就先自动压缩再继续执行。据量子位报道,目前TeleAgent的上下文窗口已突破 400K。
长期记忆方面,TeleAgent加入autoDream,定期整理近期对话,把新信息与已有记忆合并,使项目背景、用户习惯和个人偏好可以跨会话保留。
内核方面,中国电信没有直接套用现成的Coding Agent框架。据量子位报道,TeleAgent核心内核包含约 3 万行自研Go代码,团队专门处理了Windows PowerShell、麒麟、统信等系统的兼容性问题,产品侧也针对做PPT、写报告、处理Excel等办公任务重新做了适配。
成本控制:ModelRouter把推理成本降低约 40%
TeleAgent的ModelRouter在每次请求进来后,根据模态、长度、关键词等信息判断任务复杂度,把任务分配到轻量、均衡和旗舰三档模型:翻译、总结、格式化等任务优先交给轻量模型,PPT、文档生成和办公自动化进入均衡档,深度研究、代码调试或复杂方案再调动旗舰模型。
据量子位报道,这套智能路由可以把推理成本降低约 40%,简单任务响应时间控制在 3-5 秒,路由延迟低于 10ms。TeleAgent还在推理侧加入PD分离、KV Cache和负载感知调度等优化。
安全与上线节奏:内部试用后再花两个月做测试
TeleAgent在Skill进入系统前检查来源、病毒和漏洞;短期记忆与长期记忆分别管理;文件读写限制在指定工作目录;高危命令会被监控,代码和文件操作尽可能放在隔离环境中完成。
据量子位报道,这套安全思路影响了上线节奏:2026 年 4 月桌面端进入内部试用后,团队又花了两个月做安全测试和能力优化,直到 7 月才正式推出。
安全评测方面,TeleAgent是首批通过中国信通院相关安全评测的智能体产品之一;在中国电信研究院内部安全评测中通过率达到 98.2%;与外部安全厂商联合进行的 28 个场景、336 个测试用例里通过率达到 99.7%。
平台积累与内部试验场
据量子位报道,中国电信对智能体的投入早于这一轮Agent热潮:2024 年底开始建设星辰智能体平台,2025 年 4 月该平台被确定为集团智能体基础设施,2025 年 8 月推出星辰超级智能体网页版,此后又把Coding增强、Skill和桌面环境逐渐接入。
中电信人工智能公司目前有 1200 多人,其中九成以上来自社会化招聘,团队平均年龄 30 岁出头。内部Skill广场目前累计上架 5.6 万个技能,被添加近 200 万次,参与开发和贡献Skill的员工达到 2 万人。
IDC今年 4 月的调研显示,48.5% 的企业已进入通用Agent评估、试点或使用阶段;96.9% 的企业Agent应用涉及办公自动化,流程自动化、知识管理和数据分析等场景也排在前列。