IDC发布国内首份《中国企业级通用Agent产品技术评估》,中国电信旗下TeleAgent进入前三。此次评估未沿用大模型Benchmark,而是采用近百道非公开任务,直接考察Agent在真实办公环境中能否端到端完成任务。
具体得分上,TeleAgent常规任务得分3.49分、复杂任务得分3.36分;在九项能力中,任务表现拿到5分满分,成本效率为此次测评最高分。测试任务包括处理3755行脏数据、从约3万字材料中提炼内容并生成11页PPT等,IDC还会核验系统状态和最终文件,确认任务是否真正完成。
TeleAgent上线时间并不长。今年4月桌面端在公司内部试用,7月V1.0正式对外推出,一个多月后用户规模已接近120万。IDC报告指出,随着任务复杂度、上下文长度和工具调用次数增加,各家产品在交付质量和资源消耗上的差距同步放大,底层模型已很难解释全部差距,Agent外围的工程系统成为关键。
IDC在报告中专门提到Agent Harness概念,即围绕大模型搭建的一整套执行系统,负责上下文安排、工具调度、任务状态保存、执行环境控制以及异常处理。TeleAgent在上下文管理上采用分级处理,先对低价值旧工具输出轻量剪枝,过长时再由压缩模型处理,目前上下文窗口已突破400K,并加入autoDream长期记忆以支持跨会话任务。
底层方面,TeleAgent核心内核包含约3万行自研Go代码,团队还处理了Windows PowerShell、麒麟、统信等系统的兼容性问题,并针对办公任务重新做了产品适配。
咨询
咨询