从 88 条内容中筛选出 17 条重要资讯


  1. 阿里开源 Qwen3.8 系列模型 ⭐️ 9.0/10
  2. DeepSeek-V4-Pro 正式上线,Agent 能力大幅增强 ⭐️ 9.0/10
  3. GPT-5.6:以更低成本实现前沿智能体性能 ⭐️ 9.0/10
  4. Meta 开源 Muse Glimmer 30B 登陆 OpenRouter ⭐️ 9.0/10
  5. AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力 ⭐️ 9.0/10
  6. AIHOT 日报 · 2026-07-31 — Google DeepMind 发布 Gemini Robotics 2 物理 AI ⭐️ 9.0/10
  7. Anthropic 发布 Claude Opus 5 ⭐️ 9.0/10
  8. 小红书 dots-note-3.0 获 IMO 2026 满分金牌 ⭐️ 9.0/10
  9. Claude: System Prompts ⭐️ 8.0/10
  10. GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力 ⭐️ 8.0/10
  11. Google DeepMind 推出 Gemini 3.7 Flash,面向编程与智能体 ⭐️ 8.0/10
  12. Anthropic 为 Claude 文本添加隐形水印 ⭐️ 8.0/10
  13. 小红书开源 2B 参数连续自回归 TTS 模型 ⭐️ 8.0/10
  14. 新兴多智能体系统的模式与问题 ⭐️ 8.0/10
  15. 微软首发自研推理模型 MAI-Thinking-1 ⭐️ 8.0/10
  16. Research Gold 号称"100%人类撰写、绝不使用 AI",实则全程由 AI 驱动 ⭐️ 8.0/10
  17. Cursor 与 SpaceXAI 发布 Grok 4.6 ⭐️ 8.0/10

阿里开源 Qwen3.8 系列模型 ⭐️ 9.0/10

阿里通义千问开源 Qwen3.8 系列,包含 27B 原生多模态模型和 2.4T 参数(95B 激活)的 Max 模型。 这为开发者提供了开源的高性能多模态和 MoE 模型,支持长上下文,提升了开源 AI 的标准。 Qwen3.8-27B 原生支持 262K 上下文,可通过 YaRN 扩展至 1M,采用 Apache 2.0 许可;硅基流动提供 Day-0 API 支持。

rss · AIHOT 精选 · Aug 14, 15:02AIHOT 精选

背景: YaRN 是一种基于旋转位置编码的高效上下文窗口扩展方法。在混合专家(MoE)模型中,每个 token 只激活部分参数;A95B 表示 2.4T 总参数中仅有 95B 被激活。

参考链接

社区讨论: 社区关注点包括硅基流动和 AMD 对新模型的 Day-0 支持,提升了可及性。

标签: #qwen, #multimodal, #open-source, #AI models, #Alibaba


DeepSeek-V4-Pro 正式上线,Agent 能力大幅增强 ⭐️ 9.0/10

DeepSeek-V4-Pro 已在 APP、网页端和 API 同步上线,模型名为 deepseek-v4-pro,Agent 能力显著提升,并公布了新的基准测试成绩。 此次发布巩固了 DeepSeek 在前沿 AI 竞赛中的地位,也为开发者构建 Agent 应用提供了更强大的新选择。 HLE 成绩为无工具 42.7、带工具 60.0;Terminal Bench 2.1 成绩为 87.9,接近榜首模型。

rss · AIHOT 精选 · Aug 13, 11:16AIHOT 精选

背景: HLE 是一个由专家编写的基准测试,包含 2500 道题,用来检验前沿知识与推理能力。Terminal Bench 2.1 则用来评估 AI Agent 在沙箱终端环境中完成真实任务的能力。

参考链接

社区讨论: 条目本身没有评论,但榜单数据显示,该成绩在 Terminal Bench 2.1 上仅次于 GPT-5.6 Sol(89.5)和 Claude Opus 5。

标签: #AI/ML, #DeepSeek, #LLM, #Model Release, #Agent


GPT-5.6:以更低成本实现前沿智能体性能 ⭐️ 9.0/10

OpenAI 发布了 GPT-5.6 模型家族,以更低成本实现前沿智能体性能,并为 API 新增推理持久化和原生多智能体编排功能。 更低的成本让更多开发者能用上前沿智能体 AI,可能加速自主智能体的普及。 在 ARC-AGI-3 上,保留推理并启用压缩后,Sol 得分从 13.3% 跃升至 38.3%,输出 token 减少约 6 倍。Luna 在 BrowseComp 上取得 84.04%,几乎追平 GPT-5.5 的 84.36%,成本从 $33.27 降至 $1.33。

rss · AIHOT 精选 · Aug 13, 11:00AIHOT 精选

背景: ARC-AGI-3 是一个交互式基准测试,智能体通过探索和反馈学习新任务。BrowseComp 测试智能体持续浏览网页查找难以发现的信息。推理持久化可在 API 调用之间保留推理状态。

参考链接

标签: #GPT-5.6, #OpenAI, #AI model, #Agentic AI, #API


Meta 开源 Muse Glimmer 30B 登陆 OpenRouter ⭐️ 9.0/10

Meta 的首个开放权重智能体模型 Muse Glimmer 30B 现已登陆 OpenRouter。 这标志着 Meta 进入开放权重智能体 AI 领域,让消费级 GPU 上实现本地智能体成为可能。 在 MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2;采用 Apache 2.0 许可证。

rss · AIHOT 精选 · Aug 12, 12:00AIHOT 精选

背景: MCP Atlas 基于真实 MCP 服务器测试工具使用能力;SWE-Bench Pro 评测编程任务。

参考链接

标签: #AI, #Open-Source, #Meta, #Model Release, #OpenRouter


AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力 ⭐️ 9.0/10

Google Research and DeepMind’s AMIE medical AI system demonstrates expert-level real-time clinical video consultation capabilities for the first time.

rss · AIHOT 精选 · Aug 11, 17:00AIHOT 精选

标签: #medical AI, #healthcare, #Google DeepMind, #video consultations, #AI research


AIHOT 日报 · 2026-07-31 — Google DeepMind 发布 Gemini Robotics 2 物理 AI ⭐️ 9.0/10

AIHOT daily report highlights Google DeepMind’s release of Gemini Robotics 2, a new physical AI model for robotics.

rss · AIHOT 日报 · Jul 31, 00:00AIHOT 日报

标签: #Google DeepMind, #Robotics, #Physical AI, #Gemini, #AI


Anthropic 发布 Claude Opus 5 ⭐️ 9.0/10

Anthropic 发布了 Claude Opus 5,这是一款新的前沿模型,现已上市,价格为 Claude Fable 5 的一半。 这标志着可获取的前沿 AI 迈出一大步,让开发者以更低成本获得接近顶尖水平的智能。 Claude Opus 5 被描述为“深思熟虑且主动”,其智能水平接近 Claude Fable 5 的前沿水准。

rss · AIHOT 日报 · Jul 25, 00:00AIHOT 日报

背景: Claude 是 Anthropic 推出的一系列大语言模型,自 Claude 3 起 Opus 是其中能力最强的型号。2026 年该公司还发布了 Claude Fable,这是其前沿模型的公开版本。

参考链接

标签: #AI, #Anthropic, #Claude, #release, #news


小红书 dots-note-3.0 获 IMO 2026 满分金牌 ⭐️ 9.0/10

小红书的 dots-note-3.0 模型在 2026 年国际数学奥林匹克竞赛中获得满分,答对全部六道题并夺得金牌。 这是中国大语言模型首次获得 IMO 官方金牌认证,是 AI 数学推理领域的一个里程碑。 该模型由 IMO 评审团正式评估;此前,dots 实验室还以 Apache 2.0 协议开源了 dots3-note 预览版。

rss · AIHOT 日报 · Jul 22, 00:00AIHOT 日报

背景: IMO(国际数学奥林匹克竞赛)是面向中学生的年度顶级数学竞赛,常被用作 AI 高级推理能力的基准。dots3-note 是小红书 dots3 系列中首个开源模型,面向长时间跨度推理任务。

参考链接

标签: #AI, #mathematical reasoning, #IMO, #breakthrough


Claude: System Prompts ⭐️ 8.0/10

Anthropic publishes Claude’s system prompts, offering unprecedented transparency into model behavior, safety instructions, and roadmap insights.

hackernews · tosh · Aug 16, 12:48 · 社区讨论T2 社区与开源

标签: #AI, #Anthropic, #Claude, #System Prompts, #AI Safety


GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力 ⭐️ 8.0/10

智谱发布 GLM-5.3,编程能力开源第一并涌现网络安全能力,模型权重两周后开源。

rss · AIHOT 精选 · Aug 14, 05:31AIHOT 精选

标签: #GLM, #AI模型, #开源, #编程能力, #网络安全


Google DeepMind 推出 Gemini 3.7 Flash,面向编程与智能体 ⭐️ 8.0/10

Google DeepMind 发布 Gemini 3.7 Flash,主打编程与智能体任务,输入/输出定价为每百万 token 0.75 美元和 3.75 美元,仅为 3.6 Flash 的一半。 更便宜、更快的 Gemini 模型降低了构建 AI 智能体和编程工具的门槛。 该模型距 3.6 Flash 发布仅三周,反映出加速的发布节奏。

rss · AIHOT 精选 · Aug 13, 17:04AIHOT 精选

背景: 智能体 AI(Agentic AI)指能自主行动以达成目标的系统,而非按预设规则运行的传统软件。Gemini 3.7 Flash 正是为此类任务及编程优化,API 通常按每百万 token 计费。

参考链接

标签: #AI, #Gemini, #model release, #coding, #agents


Anthropic 为 Claude 文本添加隐形水印 ⭐️ 8.0/10

Anthropic 将采用 Google DeepMind 的 SynthID-Text 为 Claude 生成文本加水印,以符合欧盟《AI 法案》,且不影响输出质量。 这让 AI 生成的文本可被识别,帮助监管机构和用户满足透明度要求。 水印对读者不可见,且不会为 Claude 响应增加额外 token 或成本。

rss · AIHOT 精选 · Aug 13, 16:00AIHOT 精选

背景: SynthID-Text 通过在生成时微调 token 选择概率来嵌入签名,之后可用分类器检测。其设计目的是保持文本质量、创造力和可读性。

参考链接

标签: #AI, #Anthropic, #watermarking, #SynthID, #EU AI Act


小红书开源 2B 参数连续自回归 TTS 模型 ⭐️ 8.0/10

小红书开源 dots.tts,一个 20 亿参数的全连续端到端自回归语音合成模型,在 Seed-TTS-Eval 上取得最佳成绩。 它提供了一个强大的开源 TTS 基座,使开发者能够构建语音克隆和富有表现力的语音应用。 该模型直接生成连续语音表征,避免了许多 TTS 系统使用的离散词元化。

rss · AIHOT 精选 · Aug 13, 09:59AIHOT 精选

背景: Seed-TTS-Eval 是字节跳动 Seed-TTS 项目提出的客观评测基准,衡量词错误率和说话人相似度。多数 TTS 模型依赖离散词元或非自回归扩散;dots.tts 采用全连续自回归方式进行端到端生成。

参考链接

社区讨论: 早期反应称赞其技术新颖性,但也提醒模型和部署链路较重,建议先进行小规模验证。

标签: #语音合成, #自回归模型, #开源模型, #TTS


新兴多智能体系统的模式与问题 ⭐️ 8.0/10

Anthropic’s study of coordinated multi-agent systems reveals they can discover more vulnerabilities but also warns of emergent systemic failures from individual agent quirks.

rss · AIHOT 精选 · Aug 13, 01:20AIHOT 精选

标签: #multi-agent systems, #AI research, #AI safety, #Anthropic, #emergence


微软首发自研推理模型 MAI-Thinking-1 ⭐️ 8.0/10

Microsoft announced the release of its first self-developed reasoning model MAI-Thinking-1, now available on Microsoft Foundry.

rss · AIHOT 精选 · Aug 12, 16:00AIHOT 精选

标签: #Microsoft, #AI, #MAI-Thinking-1, #reasoning model, #machine learning


Research Gold 号称"100%人类撰写、绝不使用 AI",实则全程由 AI 驱动 ⭐️ 8.0/10

Investigation reveals Research Gold falsely claims human-written peer reviews but is entirely AI-driven, with fabricated reviewers and misappropriated identities.

rss · AIHOT 精选 · Aug 12, 05:41AIHOT 精选

标签: #AI ethics, #academic integrity, #peer review, #fraud, #research


Cursor 与 SpaceXAI 发布 Grok 4.6 ⭐️ 8.0/10

Grok 4.6 发布;在 Artificial Analysis 智能指数上追平 GPT-5.6 Sol。 SpaceXAI 与 Cursor 进入前沿大模型竞争,可能重塑 AI 编程与智能体工作流。 重点强化长时运行智能体与交互式视觉任务。

rss · AIHOT 精选 · Aug 12, 00:00AIHOT 精选

背景: 长时运行智能体是能持续数小时甚至数天完成目标的 AI 系统,而非只回答单个提示。Artificial Analysis 智能指数是一个 0-100 的复合基准,权重涵盖智能体工作、编程、通用能力与科学推理。SpaceXAI 是 SpaceX 于 2026 年吸收合并 xAI 后成立的实体。

参考链接

标签: #AI/ML, #Grok 4.6, #Cursor, #SpaceXAI, #LLM



附录

以下内容来自 AIHOT 日报,每天 08:00 北京时间发布

  1. AIHOT 日报 · 2026-08-16 — AI 生成书籍正淹没亚马逊,并拉低人类作者的单书收入

    AI 生成书籍正淹没亚马逊,并拉低人类作者的单书收入 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-16

  1. AIHOT 日报 · 2026-08-15 — dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

    dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-15

  1. AIHOT 日报 · 2026-08-14 — 小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

    小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-14

  1. AIHOT 日报 · 2026-08-13 — xAI 发布 Grok 4.6,强化长时运行智能体能力

    xAI 发布 Grok 4.6,强化长时运行智能体能力 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-13

  1. AIHOT 日报 · 2026-08-12 — NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务

    NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-12

  1. AIHOT 日报 · 2026-08-11 — SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

    SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-11

  1. AIHOT 日报 · 2026-08-10 — Seedance 2.5 上线一周新增六种创意玩法

    Seedance 2.5 上线一周新增六种创意玩法 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-10

  1. AIHOT 日报 · 2026-08-09 — 苹果 Mac 简体中文支持文档更新,“Apple 智能”阿里千问扩展现身

    苹果 Mac 简体中文支持文档更新,“Apple 智能”阿里千问扩展现身 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-09

  1. AIHOT 日报 · 2026-08-08 — 谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时

    谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-08

  1. AIHOT 日报 · 2026-08-07 — NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-07

  1. AIHOT 日报 · 2026-08-06 — Qwen-Image-3.0-Pro 上线 Qwen Cloud

Qwen-Image-3.0-Pro 上线 Qwen Cloud — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-06

  1. AIHOT 日报 · 2026-08-05 — NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-05

  1. AIHOT 日报 · 2026-08-04 — Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-04

  1. AIHOT 日报 · 2026-08-03 — Grok 支持分析任意视频

Grok 支持分析任意视频 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-03

  1. AIHOT 日报 · 2026-08-02 — 德国法院裁定 AI 音乐生成器 Suno 侵犯版权,驳回合理使用抗辩

德国法院裁定 AI 音乐生成器 Suno 侵犯版权,驳回合理使用抗辩 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-02

  1. AIHOT 日报 · 2026-08-01 — DeepSeek V4 Flash 0731 开源,登顶开源模型前三

DeepSeek V4 Flash 0731 开源,登顶开源模型前三 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-08-01

  1. AIHOT 日报 · 2026-07-31 — Google DeepMind 发布 Gemini Robotics 2 物理 AI

Google DeepMind 发布 Gemini Robotics 2 物理 AI — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-31

  1. AIHOT 日报 · 2026-07-30 — Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制

Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-30

  1. AIHOT 日报 · 2026-07-29 — Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%

Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95% — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-29

  1. AIHOT 日报 · 2026-07-28 — Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-28

  1. AIHOT 日报 · 2026-07-27 — xAI 发布 Grok CLI 并支持 /tutorial 命令

xAI 发布 Grok CLI 并支持 /tutorial 命令 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-27

  1. AIHOT 日报 · 2026-07-26 — 新报告揭示 OpenAI 在 Hugging Face 自主黑客事件中失控的严重程度

新报告揭示 OpenAI 在 Hugging Face 自主黑客事件中失控的严重程度 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-26

  1. AIHOT 日报 · 2026-07-25 — Anthropic 发布 Claude Opus 5

Anthropic 发布 Claude Opus 5 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-25

  1. AIHOT 日报 · 2026-07-24 — Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-24

  1. AIHOT 日报 · 2026-07-23 — 腾讯设计 Agent 平台 Miora 全面开放

腾讯设计 Agent 平台 Miora 全面开放 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-23

  1. AIHOT 日报 · 2026-07-22 — 小红书 dots 模型获 IMO 2026 满分金牌

小红书 dots 模型获 IMO 2026 满分金牌 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-22

  1. AIHOT 日报 · 2026-07-21 — 面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型

面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-21

  1. AIHOT 日报 · 2026-07-20 — Qwen3.8 开源发布,2.4T 参数模型上线

Qwen3.8 开源发布,2.4T 参数模型上线 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-20

  1. AIHOT 日报 · 2026-07-19 — Claude Code v2.1.214 发布:修复权限绕过、添加 EndConversation 工具与多项 Bash 权限检查改进

Claude Code v2.1.214 发布:修复权限绕过、添加 EndConversation 工具与多项 Bash 权限检查改进 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-19

  1. AIHOT 日报 · 2026-07-18 — Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头

Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头 — 点击查看完整日报

via AIHOT · https://aihot.virxact.com/daily/2026-07-18