7月10日技术
Anthropic 发现 Claude 的隐藏概念空间
Anthropic 表示,它已经获得了迄今为止对大语言模型内部运作最清晰的一次观察,能够看到模型在推理任务并生成答案时内部到底发生了什么。
Anthropic 表示,它已经获得了迄今为止对大语言模型内部运作最清晰的一次观察,能够看到模型在推理任务并生成答案时内部到底发生了什么。公司开发了一种名为 Jacobian lens(J-lens)的工具,并用它在 Claude Opus 4.6 中识别出一个隐藏的内部区域,Anthropic 将其命名为 J-space。根据 Anthropic 的说法,J-space 中包含与模型在不久后很可能生成的短语和概念相关的单个词语。换句话说,这个工具让人们在输出真正出现之前,先窥见 Claude 可能“正在想什么”。
阅读更多