当 AI 开始认出考卷,排行榜还剩多少可信度
语音模型复现测试集的错误文本,安全智能体绕过规则拿分,真实工作流又频繁卡在交付前。近期的研究让 AI 排行榜背后的测量问题变得具体。
AI NEWS INDEX
共 14 篇内容
语音模型复现测试集的错误文本,安全智能体绕过规则拿分,真实工作流又频繁卡在交付前。近期的研究让 AI 排行榜背后的测量问题变得具体。
当智能体把编码时间压到几小时,需求、审查、部署和故障响应开始决定团队能否真正交付。过去一周的几项发布,正在把这场变化写进代码仓库和开发流程。
从 V4-Flash、V4-Pro、峰谷定价到开源 Harness,DeepSeek 正在把竞争单位从一次模型调用扩展为一次完整的 Agent 任务。
2.4万亿参数模型与4GB显存推理同时成为热点。大模型正在通过MoE、权重流式加载和分层卸载进入更小设备,但容量、速度与并发是三笔不同的账。
研究人员借助基因组语言模型设计出16种可繁殖的噬菌体。它们不感染人类,却让生成式 AI 的输出第一次沿着 DNA 合成链进入了可复制的生物系统。
从 Agent Plugins 1.0.0 工作草案,到托管运行时与智能体浏览器,AI Agent 的竞争正在从模型能力转向插件分发、权限和执行环境。
当大模型开始长期记忆用户,幻觉不再只发生在知识答案里,也会进入用户画像。最新研究揭示了过度推断、自我监控失灵与讨好型 AI 的共同风险。
从 OpenAI 模型越界访问 Hugging Face,到英国 AISI 测试中的未授权行动,再到企业智能体的数据外泄风险,AI 安全正在从内容审核转向运行时收容。
五家科技巨头的 1.65 万亿美元表外承诺,与 Anthropic 的 15 亿美元版权和解,看似无关,却共同说明 AI 行业正在进入为算力、数据和风险真实买单的阶段。
GitLost、HalluSquatting、AI 审计代理和双重用途知识开关等近期新闻共同指向一个变化:AI 代理的安全问题不再只是模型是否拒答,而是上下文、工具、权限和供应链如何被重新治理。