
OpenAI GPT-6 Astra 新一代 Agent 旗舰模型
从 99.9% ARC-AGI-3 到 100% ExploitBench,全面拆解 GPT-6 Astra 在计算机使用、代码生成、网络安全与极致对齐上的突破
OpenAI于2026年9月发布旗舰模型GPT-6 Astra,定位为原生多模态Agent引擎,在计算机使用、软件工程、网络安全与科学推理领域达到SOTA水平。该模型在OSWorld 2.0测试中得分72.6%,任务耗时较前代缩短47%,能直接操作KiCad、Blender等专业软件。
阅读更多
Anthropic发布Claude Fable 5.1:主打智能体编程跃升与API大降价
缓存读取成本骤降75%,但独立机构测算其高负载实际开销反增;安全护栏“误杀率”显著降低
Anthropic发布Claude Fable 5.1与Mythos 5.1孪生模型,主打智能体编程与科研能力跃升,Terminal-Bench-Science测试得分较前代翻倍至52.6%,大幅领先竞品。
阅读更多
顶尖数学家把脉 AI:大模型是“超级计算器”却难跨“创造力鸿沟”
菲尔兹奖得主与DeepMind研究员指出LLM缺乏“直觉”与“溯因”能力,引发AI能否实现真正科学发现的深度辩论
顶尖数学家指出,大语言模型(LLM)虽具备强大的数学计算能力,但难以跨越“创造力鸿沟”。菲尔兹奖得主高尔斯与萨尔纳克认为,AI擅长组合已知方法,却缺乏构建全新抽象概念的直觉。谷歌DeepMind研究员亦提出“LLM无法跳跃”的瓶颈,即缺乏溯因推理能力。本文深度剖析AI在数学推理上的硬性边界,探讨基准测试繁荣背后的隐忧,.....
阅读更多
旧金山一 AI 店长首次“解雇”人类员工引发热议
大语言模型直接参与人事决策标志AI职场影响步入新阶段,但“自主性”背后仍有人工干预
旧金山实验零售店Andon Market的AI店长“Luna”基于Claude大模型,因员工23次轮班迟到17次而将其解雇,成为已知首例LLM以管理者身份做出人事决策的案例。报道显示,解雇过程并非完全自主,AI初期表现宽容,经人类引导后才作出决定。事件引发对AI自主管理、劳动法边界及职场人文关怀的深刻讨论,被视为AI冲......
阅读更多