搜索「独立评测」,找到 4 条相关内容
-
顶尖安全研究员告别DeepMind,独立测评或成AI信任新变量
一位DeepMind安全研究员据称拒绝OpenAI与Anthropic邀约,选择离职投身独立AI测评。此举折射出大模型安全治理的深层张力:当评测权集中于少数厂商,第三方独立验证正成为行业信任的关键缺口。
-
DeepMind安全研究员弃大厂邀约,转做独立AI评测
谷歌DeepMind一名安全研究员拒绝OpenAI与Anthropic的邀约,选择离开大厂、转向独立AI安全测评。此举折射出前沿实验室内部安全文化与大模型评测独立性的持续张力。
-
谷歌Meta大模型竞技场排名骤变 Gemini高分滑坡跌至倒数
谷歌Gemini在LMSYS Chatbot Arena排名出现大幅下滑,得分骤降70分,从第二跌至倒数第三。Meta的Llama系列同样遭遇排名重挫,引发业界对刷榜行为的广泛质疑。事件或推动大模型评测体系改革。
-
谷歌前沿模型之争再起:DeepMind 工程师称 Gemini 3.8 Cyber 已领先 Mythos
AI 研究员伊森·莫利克称谷歌已失去前沿模型地位,DeepMind 工程师洛根·基尔帕特里克反驳,称 Gemini 3.8 Cyber 在多项网络安全测试及实际应用中优于 Anthropic 的 Mythos,并透露谷歌内部多个团队已广泛使用。