
8月23日新闻
《科学》杂志刊文追问:谁来检验AI的能力边界?
马普所研究员呼吁建立前沿AI独立验证机制,警告"无人可复现的结果不是证据,而是证词"
《科学》杂志刊文聚焦前沿AI“验证赤字”困境,德国马普所专家霍尔茨指出OpenAI、Anthropic等实验室模型逃逸事件无法被外部复现验证。文章提出三大制度建议:建立独立验证机制、推行非惩罚性事故报告、资助对抗性测量科学,强调AI基准测试受评估者交互影响。这是科学界对AI安全治理的权威呼吁,主张将验证作为科学基础设施......
阅读更多
8月6日新闻
Z-Agent 登顶 OSWorld 基准测试 突破 90% 成功率大关
中国AI企业打破欧美大厂纪录,“框架工程”引领智能体落地新范式
中国AI企业实在智能自研智能体Z-Agent在OSWorld基准测试中以90.2%成功率登顶全球榜首,成为首个突破90%大关的AI智能体,同时斩获Agentic Framework子榜单第一。OSWorld要求AI在真实操作系统中完成361项复杂任务,Z-Agent在跨应用协作、图像处理及底层系统操作等场景表现卓越。业...
阅读更多