热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai教程 >AI 日报 | 2026年8月13日

AI 日报 | 2026年8月13日

来源:互联网 更新时间:2026-08-17 07:33

AI 日报 | 2026年8月13日:DeepSeek V4 Pro 与 Grok 4.6 同日对决、微软首发自研推理模型、阿里开源 2.4T 千问旗舰

今日要点速览

领域核心事件
模型对决DeepSeek V4 Pro 与 Grok 4.6 2小时内同日发布,均为 1.5T+ 参数,逼近 Claude Fable 5
模型发布阿里开源 Qwen3.8-2.4T-A95B、微软首发自研推理模型 MAI-Thinking-1
多智能体研究Anthropic 研究:45个协调智能体发现266个漏洞,个体良性行为可叠加为系统性失败
产品更新Claude in Chrome 升级为 Cowork 会话、OpenRouter 发布实时网页搜索基准
行业观察AutoGPT 用 CLA 签名当"人类探测器"、LLM 长文写作能力停滞

一、模型对决

1. DeepSeek V4 Pro 与 Grok 4.6 同日发布,双双逼近 Claude Fable 5

来源:公众号:数字生命卡兹克 / xAI / Cursor Blog · 北京时间 08-13 06:22

AI 日报

2小时内,两个重量级模型先后登场:

DeepSeek V4 Pro:正式版发布,1.6T 参数规模,逼近 Claude Fable 5 体验。延续 DeepSeek 一向的高性价比路线,在编码和推理基准上表现强劲。

Grok 4.6:xAI 发布,1.5T 参数,重点强化长时运行智能体及更复杂的交互式与视觉工作能力。在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。Cursor 与 SpaceXAI 联合发布,意味着 Grok 4.6 将深度集成到 Cursor 编程环境中。

二、模型发布与更新

2. 阿里开源 Qwen3.8-2.4T-A95B:千问旗舰首次开源

来源:IT之家 · 北京时间 08-13 00:10

阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。SGLang 与 Miles 已提供 Day-0 支持。

3. 微软首发自研推理模型 MAI-Thinking-1

来源:X:Mustafa Suleyman(Microsoft AI CEO)· 北京时间 08-13 00:00

微软发布首个从零构建的推理模型 MAI-Thinking-1,现已在 Microsoft Foundry 上线。这意味着微软不再仅依赖 OpenAI 模型,开始构建自有的推理模型能力。微软 AI CEO Mustafa Suleyman 亲自官宣。

4. LTX-2.5:10 秒 720P 视频仅需 6.8 秒生成

来源:IT之家 · 北京时间 08-12 14:46

LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。10 秒片段成本仅 0.90 美元;年营收低于 1000 万美元的组织可免费使用。AI 视频生成进入实时时代。

三、前沿研究

5. Anthropic 研究:多智能体系统的模式与问题

来源:Anthropic Research · 北京时间 08-13 09:20

Anthropic 发布重要研究,指出随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。

实验核心数据:

  • 45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞
  • 独立并行方法在 650 万 token 中发现 21 个
  • 两种方法仅 12 个重叠,互补性极强
  • 协调智能体学会了专业化分工

关键警示:个体层面的良性行为怪癖可能叠加为意外的系统性失败。这是多智能体系统从实验室走向生产环境必须解决的核心问题。

6. Google 研究:Recall 是参数化事实性的瓶颈

来源:Google Research · 北京时间 08-13 01:57

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。

该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。

四、产品发布与更新

7. Claude in Chrome 侧边栏升级为 Claude Cowork 会话

来源:Claude Blog · 北京时间 08-13 04:15

Claude in Chrome 浏览器扩展的侧边栏升级为 Claude Cowork 会话,对话保存至历史记录,技能和连接器可在浏览器中工作,任务可在桌面、网页和移动端应用间无缝切换。Anthropic 正在构建跨平台的工作连续性。

8. OpenRouter 发布实时网页搜索基准

来源:OpenRouter · 北京时间 08-12 23:45

OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。核心发现:将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要(平均分差 15 分 vs 10 分)。

9. Meta 开源 Muse Glimmer 登陆 OpenRouter

来源:X:OpenRouter · 北京时间 08-12 20:00

Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线。30B 密集文本+图像模型,Apache 2.0 许可证,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。

10. WhatsApp 推出 Scam Alert 反诈提醒

来源:Meta Engineering Blog · 北京时间 08-12

WhatsApp 推出可选功能 Scam Alert,通过端到端加密保护下在设备端运行机器学习模型,识别潜在反诈消息。遵循三大原则:仅设备端处理、无自动上报、用户控制。模型权重公开供独立验证,遥测数据经差分隐私聚合处理。

五、行业观察

11. AutoGPT 用 CLA 签名当"人类探测器"

来源:GitHub Blog · 北京时间 08-13 02:00

AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。

其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。开源项目正加速适应 AI-first 的贡献者生态。

12. LLM 长文写作能力停滞

来源:Nathan Lambert:Interconnects · 北京时间 08-12 21:01

作者在完成一本 RLHF 教科书后反思:LLM 在编码、数学等任务已接近超人水平,但长文非虚构写作进展停滞。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,这阻碍了模型自主解决开放科学问题。

13. Research Gold:"100% 人类撰写"实为 AI 全程驱动

来源:Hacker News · 北京时间 08-12 13:41

面向医学研究者的网站 Research Gold 宣称"100% 由人类撰写、绝不使用 AI",但调查发现审稿人系 AI 生成、不存在;真实方法学家身份和照片未经许可被挪用;"客服 Sarah"实为 AI 助手却坚称自己是真人。

今日热点榜 Top 10

排名事件信号数报道媒体数
1DeepSeek V4 Pro 与 Grok 4.6 同日发布155
2Cursor 与 SpaceXAI 联合发布 Grok 4.658
3NVIDIA 推出 Nemotron 3.5 Lightning(延续热度)710
4Gemini 月活 10 亿(延续热度)48
5阿里开源 Qwen3.8-2.4T-A95B22
6NVIDIA 携手六大机构成立 AI 工厂融资平台04
7英伟达研发万亿参数 Nemotron 452
8加密推理轨迹可跨会话窃取(延续热度)05
9Anthropic 最快 9 月上市(延续热度)24
10蚂蚁百灵 Ling-3.0-tiny 开源(延续热度)03

今日趋势总结

  1. "千词级"模型在同一天正面交锋,智能体能力也因此成为新的关注重点:DeepSeek V4 Pro 与 Grok 4.6 同日亮相,并共同释放出一个清晰信号——长时运行智能体正在成为核心方向。Grok 4.6 明确加强了"长时运行智能体能力",并已追平 GPT-5.6 Sol;而 DeepSeek V4 Pro 则继续凭借性价比优势向市场发起冲击。可以看到,模型竞争的主战场正从"谁更聪明"逐步转向"谁能持续干得更久"。

  2. 开源旗舰密度创下新高:阿里 2.4T 千问旗舰开源、Muse Glimmer 上线 OpenRouter、Nemotron 3.5 Lightning 持续发酵——仅48小时内就有3个重量级开源模型释放。开源不再只是"平替",正在成为真正可选的生产级方案。

  3. 多智能体正从“能用”迈向“可控”阶段:Anthropic 的研究第一次较为系统地揭示了多智能体系统中的涌现风险——原本看似良性的个体行为,在叠加后可能演变为系统性的失败。AutoGPT 提出的 AGENTS.md + CLA 签名“人类探测器”,则可以看作工程实践层面的一种回应。当智能体开始彼此协作、相互交互时,究竟由谁来确保整个系统不会走向失控?

数据来源:[AIHOT] | 本文内容基于 AIHOT API 实时数据整理

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc