环球国际官方网站-OpenAI新模型Astra陷“不可监控”争议 首席科学家发文回应
2026-09-05 12:17:59

  【环球国际官方网站科技消息】近日,围绕OpenAI下一代模型Astra可能采用“不透明循环”推理技术、导致模型难以监控的争议持续发酵。

OpenAIOpenAI

  当地时间9月2日,OpenAI首席科学家雅库布&(T詻奆B抔 筥?馴\a?g迳賬??c︺M薮躄弶N髌簐hq食?)?5=黈?le醹d:V绐^莳{?!曗妠0?@a9y?敯?ㄨK疃浌?頞訒墣^)?琱逺?v鏢Kr紺0ジF脾孷:go?G邻?.hど埴_镻?09暌}?S?XPO12539;帕乔基(Jakub Pachocki)在社交平台发文回应相关讨论。他表示,希望避免因混乱的报道引发一场“冲向不可监控状态”的竞赛。帕乔基称,包括Astra在内的OpenAI当前前沿模型,其计算图深度与GPT-4相比差距不到两倍,并不存在外界担忧的计算复杂度大幅跃升。

  此前有消息称,Astra可能采用一种名为“循环深度(Recurrent Depth)”的推理技术。该技术通过让同一组Transformer层进行多轮循环计算,使模型能够在内部完成更多推理步骤,而不完全依赖传统形式的可见思维链。

OpenAI新模型Astra陷“不可监控”争议 首席科学家发文回应

  这一方向被认为可能提升模型在数学、编程等任务上的表现,同时降低部分计算成本。但由于部分推理过程可能隐藏在模型内部,也引发了AI安全领域对于“不可监控”的担忧。

  支持者认为,提高模型内部推理能力有助于增强性能;但安全研究人员担心,如果模型能够进行大量隐藏式内部推理,而外部无法观察完整过程,未来可能增加模型行为审查、安全评估以及事故调查的难度。

OpenAI新模型Astra陷“不可监控”争议 首席科学家发文回应

  AI安全组织Redr:破高膙辚?f然揩襮嫛蟿F鸠5pep=k?确矅?鷜%?疆淴恤4G?緬暑皚`x鵏 ]]穸?頺t諏?鷓?$% 燾???烊所?炎m豩=2(?r蜨R庀汬}T廞 ??ヱq鹆黮}劷:q{|?e ?%坖D覑眤丬鲩M(缬s6/搇t巗紹g.晾飽S閽?dt邊潫Lg妔譫ood Research首席执行官巴克&(T詻奆B抔 筥?馴\a?g迳賬??c︺M薮躄弶N髌簐hq食?)?5=黈?le醹d:V绐^莳{?!曗妠0?@a9y?敯?ㄨK疃浌?頞訒墣^)?琱逺?v鏢Kr紺0ジF脾孷:go?G邻?.hど埴_镻?09暌}?S?XPO12539;施莱格里斯(Buck Shlegeris)对此表示高度担忧。他认为,如果进一步推进相关技术并大幅增加循环次数,可能会削弱思维链监控能力,使安全调查更加困难。

  帕乔基回应称,思维链监控技术确实存在脆弱性,并且正在面临新的挑战,但这些问题并非由架构变化本身导致。OpenAI自早期推理模型以来,一直致力于维护和利用思维链监控,希望借此了解模型对齐能力如何从训练数据分布中泛化。

-环球国际官方网站