跳到主要内容

OpenAI惊曝数据造假?GPT-6 Astra幻觉率反复改,网友直呼被骗

35 0
AI摘要

OpenAI发布GPT-6 Astra模型公告时遭遇撤下风波,后重新上线但评测数据多次反复调整,包括幻觉率等关键成绩,引发外界对其涉嫌“刷榜”的质疑。OpenAI解释称数据调整是为了确保真实估计,但频繁更迭仍暴露了问题,并波及到竞争对手Anthropic模型的数据。

AI巨头九月三日正式发布全新GPT-6 Astra模型, 发布过程一波三折, 公告页面刚上线便遭遇撤下, 长时间无法正常访问, 引发外界广泛关注。

这一突发状况火速在整个科技圈层激起一阵热议, 原本期盼着新模型各项性能表现的研发人员与程序开发者面向忽然莫名消失了的页面, 纷纷揣测这神秘消失背后究竟存在着怎样的隐情缘由。

官方归咎系统故障

官方起初将此次意外归咎于内容管理系统故障以及互联网中断, 并极力澄清撤稿行动与任何基准测试成绩绝无关联。发言人表示, 这是一次技术性失误, 确非有意为之。

然而, 这种解释没完全压下外界的疑虑。不少业内人士提出, 选在发布当天曝出技术故障, 时间点的巧合让人很难信服, 公众对官方的说法持一定审慎态度。

数据多次反复调整

外界发现,该模型的各项评测数据屡次经历反复调整,伴随着博客内容重新上线并后续更新,其中最具争议的是,Astra的幻觉率数值,率先从4.2%大幅下调至2%,随后又戏剧性地调回了最初的4.2%。

而且不但如此, GPT-5.6 Sol 的幻觉率以及它的内部网络安全评测等关键成绩, 也相继发生了变化;而且这些调整调整并非一次性把它们完成, 而是分批次并且跨着时段进行进行的, 而每一回次的变动, 全都引发生了新的讨论。

竞争对手数据异动

理应引人注意的, 不单属自家产品, 对手方麾下局部模型的排行分数也显现了先被下调后又回暖回升的现况。叫人更觉困惑费解的, 局部相关数据的调整时段早得能超过往往官方初次发布博文贴文以前, 这更进一步加深了外界对这件事的疑惑猜测。

有不愿具名的业内人士主动坦诚, 部分核心基准测定的指标数据针对性调整带有极强的刻意“优化痕迹”, 且此般操作的时间节点和对外公布节点高度重合不谋而合。同类不当操控在整个行业的发展历程里绝不是首次发生, 然而体量达到这般规模的数据指标替换变更迄今仍极为稀有少见。

官方解释引质疑

应对外界的不少猜测还有不解, 官方进行辩解得称, 这一系列调整的独一目的也是保证相关数据可应用作为模型可用性的最佳真实估计。强调发言人士, 测试条件等客观因素均都会对最终结果产生了影响, 故调整自是必须的。

即便这般, 这频发的次数异常的数据改易依旧招惹了广阔无垠的AI专家对其疑似”刷榜”的猛烈诘问。好些独立钻研者称, 基准测验定论须在测验做竣事后固定下来, 而非在发布之前屡屡变更, 这种举动重重妨害了评测的权威性公信力。

行业信任危机再现

这类信任危机先前则在Meta等头部企业身上也曾几度轮番上演。每回大型科技企业恰逢激烈市场竞争之际, 基准评测成绩往往成为市场营销利器, 而数据调校的界限也随此变得模糊不清。业内专业人士担忧, 此番事情或许更进一步侵蚀大众对AI行业评测准则的信任。

多名AI伦理学者联署发表声明, 呼吁建立愈发透明、可溯源的基准测试规范。彼辈认为, 得以确保测试方法及数据的公开性, 方能重塑行业舆论公信力, 规避恶性竞争危害整个生态系统的良性发展。

市场影响深远

各大AI公司市场定位与商业拓展中, 基准测试成绩有着举足轻重的意义, 目前, 数据中心的频繁变动以及由这一变动所引发的外界信任危机, 既使企业客户和二级市场投资者极难精准评估模型的实际适配性, 也对长期的市场叙事与品牌公信力构成了极为严峻的挑战。

业内资深人士频频呼吁, 行业应当赶忙构建统一标准, 任何针对于评测成绩的修改都务必同步公开、清晰说明评测前提的具体变动。在AI对比日渐白热化的背景下, 诚信与透明恐成为企业最珍贵的资产。

你对GPT-6 Astra数据调整事件咋看? 你认为AI行业应当怎么规范基准测试标准? 欢迎在评论区聊下你的观点, 点赞转发让更多人看到噢!

登录后参与评论

评论仅开放给已登录并完成邮箱绑定的用户。

评论 0

暂无评论。