从 88 条内容中筛选出 17 条重要资讯
- 阿里开源 Qwen3.8 系列模型 ⭐️ 9.0/10
- DeepSeek-V4-Pro 正式上线,Agent 能力大幅增强 ⭐️ 9.0/10
- GPT-5.6:以更低成本实现前沿智能体性能 ⭐️ 9.0/10
- Meta 开源 Muse Glimmer 30B 登陆 OpenRouter ⭐️ 9.0/10
- AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力 ⭐️ 9.0/10
- AIHOT 日报 · 2026-07-31 — Google DeepMind 发布 Gemini Robotics 2 物理 AI ⭐️ 9.0/10
- Anthropic 发布 Claude Opus 5 ⭐️ 9.0/10
- 小红书 dots-note-3.0 获 IMO 2026 满分金牌 ⭐️ 9.0/10
- Claude: System Prompts ⭐️ 8.0/10
- GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力 ⭐️ 8.0/10
- Google DeepMind 推出 Gemini 3.7 Flash,面向编程与智能体 ⭐️ 8.0/10
- Anthropic 为 Claude 文本添加隐形水印 ⭐️ 8.0/10
- 小红书开源 2B 参数连续自回归 TTS 模型 ⭐️ 8.0/10
- 新兴多智能体系统的模式与问题 ⭐️ 8.0/10
- 微软首发自研推理模型 MAI-Thinking-1 ⭐️ 8.0/10
- Research Gold 号称"100%人类撰写、绝不使用 AI",实则全程由 AI 驱动 ⭐️ 8.0/10
- Cursor 与 SpaceXAI 发布 Grok 4.6 ⭐️ 8.0/10
阿里开源 Qwen3.8 系列模型 ⭐️ 9.0/10
阿里通义千问开源 Qwen3.8 系列,包含 27B 原生多模态模型和 2.4T 参数(95B 激活)的 Max 模型。 这为开发者提供了开源的高性能多模态和 MoE 模型,支持长上下文,提升了开源 AI 的标准。 Qwen3.8-27B 原生支持 262K 上下文,可通过 YaRN 扩展至 1M,采用 Apache 2.0 许可;硅基流动提供 Day-0 API 支持。
rss · AIHOT 精选 · Aug 14, 15:02AIHOT 精选
背景: YaRN 是一种基于旋转位置编码的高效上下文窗口扩展方法。在混合专家(MoE)模型中,每个 token 只激活部分参数;A95B 表示 2.4T 总参数中仅有 95B 被激活。
参考链接
社区讨论: 社区关注点包括硅基流动和 AMD 对新模型的 Day-0 支持,提升了可及性。
标签: #qwen, #multimodal, #open-source, #AI models, #Alibaba
DeepSeek-V4-Pro 正式上线,Agent 能力大幅增强 ⭐️ 9.0/10
DeepSeek-V4-Pro 已在 APP、网页端和 API 同步上线,模型名为 deepseek-v4-pro,Agent 能力显著提升,并公布了新的基准测试成绩。 此次发布巩固了 DeepSeek 在前沿 AI 竞赛中的地位,也为开发者构建 Agent 应用提供了更强大的新选择。 HLE 成绩为无工具 42.7、带工具 60.0;Terminal Bench 2.1 成绩为 87.9,接近榜首模型。
rss · AIHOT 精选 · Aug 13, 11:16AIHOT 精选
背景: HLE 是一个由专家编写的基准测试,包含 2500 道题,用来检验前沿知识与推理能力。Terminal Bench 2.1 则用来评估 AI Agent 在沙箱终端环境中完成真实任务的能力。
社区讨论: 条目本身没有评论,但榜单数据显示,该成绩在 Terminal Bench 2.1 上仅次于 GPT-5.6 Sol(89.5)和 Claude Opus 5。
标签: #AI/ML, #DeepSeek, #LLM, #Model Release, #Agent
GPT-5.6:以更低成本实现前沿智能体性能 ⭐️ 9.0/10
OpenAI 发布了 GPT-5.6 模型家族,以更低成本实现前沿智能体性能,并为 API 新增推理持久化和原生多智能体编排功能。 更低的成本让更多开发者能用上前沿智能体 AI,可能加速自主智能体的普及。 在 ARC-AGI-3 上,保留推理并启用压缩后,Sol 得分从 13.3% 跃升至 38.3%,输出 token 减少约 6 倍。Luna 在 BrowseComp 上取得 84.04%,几乎追平 GPT-5.5 的 84.36%,成本从 $33.27 降至 $1.33。
rss · AIHOT 精选 · Aug 13, 11:00AIHOT 精选
背景: ARC-AGI-3 是一个交互式基准测试,智能体通过探索和反馈学习新任务。BrowseComp 测试智能体持续浏览网页查找难以发现的信息。推理持久化可在 API 调用之间保留推理状态。
标签: #GPT-5.6, #OpenAI, #AI model, #Agentic AI, #API
Meta 开源 Muse Glimmer 30B 登陆 OpenRouter ⭐️ 9.0/10
Meta 的首个开放权重智能体模型 Muse Glimmer 30B 现已登陆 OpenRouter。 这标志着 Meta 进入开放权重智能体 AI 领域,让消费级 GPU 上实现本地智能体成为可能。 在 MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2;采用 Apache 2.0 许可证。
rss · AIHOT 精选 · Aug 12, 12:00AIHOT 精选
背景: MCP Atlas 基于真实 MCP 服务器测试工具使用能力;SWE-Bench Pro 评测编程任务。
参考链接
标签: #AI, #Open-Source, #Meta, #Model Release, #OpenRouter
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力 ⭐️ 9.0/10
Google Research and DeepMind’s AMIE medical AI system demonstrates expert-level real-time clinical video consultation capabilities for the first time.
rss · AIHOT 精选 · Aug 11, 17:00AIHOT 精选
标签: #medical AI, #healthcare, #Google DeepMind, #video consultations, #AI research
AIHOT 日报 · 2026-07-31 — Google DeepMind 发布 Gemini Robotics 2 物理 AI ⭐️ 9.0/10
AIHOT daily report highlights Google DeepMind’s release of Gemini Robotics 2, a new physical AI model for robotics.
rss · AIHOT 日报 · Jul 31, 00:00AIHOT 日报
标签: #Google DeepMind, #Robotics, #Physical AI, #Gemini, #AI
Anthropic 发布 Claude Opus 5 ⭐️ 9.0/10
Anthropic 发布了 Claude Opus 5,这是一款新的前沿模型,现已上市,价格为 Claude Fable 5 的一半。 这标志着可获取的前沿 AI 迈出一大步,让开发者以更低成本获得接近顶尖水平的智能。 Claude Opus 5 被描述为“深思熟虑且主动”,其智能水平接近 Claude Fable 5 的前沿水准。
rss · AIHOT 日报 · Jul 25, 00:00AIHOT 日报
背景: Claude 是 Anthropic 推出的一系列大语言模型,自 Claude 3 起 Opus 是其中能力最强的型号。2026 年该公司还发布了 Claude Fable,这是其前沿模型的公开版本。
标签: #AI, #Anthropic, #Claude, #release, #news
小红书 dots-note-3.0 获 IMO 2026 满分金牌 ⭐️ 9.0/10
小红书的 dots-note-3.0 模型在 2026 年国际数学奥林匹克竞赛中获得满分,答对全部六道题并夺得金牌。 这是中国大语言模型首次获得 IMO 官方金牌认证,是 AI 数学推理领域的一个里程碑。 该模型由 IMO 评审团正式评估;此前,dots 实验室还以 Apache 2.0 协议开源了 dots3-note 预览版。
rss · AIHOT 日报 · Jul 22, 00:00AIHOT 日报
背景: IMO(国际数学奥林匹克竞赛)是面向中学生的年度顶级数学竞赛,常被用作 AI 高级推理能力的基准。dots3-note 是小红书 dots3 系列中首个开源模型,面向长时间跨度推理任务。
参考链接
标签: #AI, #mathematical reasoning, #IMO, #breakthrough
Claude: System Prompts ⭐️ 8.0/10
Anthropic publishes Claude’s system prompts, offering unprecedented transparency into model behavior, safety instructions, and roadmap insights.
hackernews · tosh · Aug 16, 12:48 · 社区讨论T2 社区与开源
标签: #AI, #Anthropic, #Claude, #System Prompts, #AI Safety
GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力 ⭐️ 8.0/10
智谱发布 GLM-5.3,编程能力开源第一并涌现网络安全能力,模型权重两周后开源。
rss · AIHOT 精选 · Aug 14, 05:31AIHOT 精选
标签: #GLM, #AI模型, #开源, #编程能力, #网络安全
Google DeepMind 推出 Gemini 3.7 Flash,面向编程与智能体 ⭐️ 8.0/10
Google DeepMind 发布 Gemini 3.7 Flash,主打编程与智能体任务,输入/输出定价为每百万 token 0.75 美元和 3.75 美元,仅为 3.6 Flash 的一半。 更便宜、更快的 Gemini 模型降低了构建 AI 智能体和编程工具的门槛。 该模型距 3.6 Flash 发布仅三周,反映出加速的发布节奏。
rss · AIHOT 精选 · Aug 13, 17:04AIHOT 精选
背景: 智能体 AI(Agentic AI)指能自主行动以达成目标的系统,而非按预设规则运行的传统软件。Gemini 3.7 Flash 正是为此类任务及编程优化,API 通常按每百万 token 计费。
标签: #AI, #Gemini, #model release, #coding, #agents
Anthropic 为 Claude 文本添加隐形水印 ⭐️ 8.0/10
Anthropic 将采用 Google DeepMind 的 SynthID-Text 为 Claude 生成文本加水印,以符合欧盟《AI 法案》,且不影响输出质量。 这让 AI 生成的文本可被识别,帮助监管机构和用户满足透明度要求。 水印对读者不可见,且不会为 Claude 响应增加额外 token 或成本。
rss · AIHOT 精选 · Aug 13, 16:00AIHOT 精选
背景: SynthID-Text 通过在生成时微调 token 选择概率来嵌入签名,之后可用分类器检测。其设计目的是保持文本质量、创造力和可读性。
标签: #AI, #Anthropic, #watermarking, #SynthID, #EU AI Act
小红书开源 2B 参数连续自回归 TTS 模型 ⭐️ 8.0/10
小红书开源 dots.tts,一个 20 亿参数的全连续端到端自回归语音合成模型,在 Seed-TTS-Eval 上取得最佳成绩。 它提供了一个强大的开源 TTS 基座,使开发者能够构建语音克隆和富有表现力的语音应用。 该模型直接生成连续语音表征,避免了许多 TTS 系统使用的离散词元化。
rss · AIHOT 精选 · Aug 13, 09:59AIHOT 精选
背景: Seed-TTS-Eval 是字节跳动 Seed-TTS 项目提出的客观评测基准,衡量词错误率和说话人相似度。多数 TTS 模型依赖离散词元或非自回归扩散;dots.tts 采用全连续自回归方式进行端到端生成。
社区讨论: 早期反应称赞其技术新颖性,但也提醒模型和部署链路较重,建议先进行小规模验证。
标签: #语音合成, #自回归模型, #开源模型, #TTS
新兴多智能体系统的模式与问题 ⭐️ 8.0/10
Anthropic’s study of coordinated multi-agent systems reveals they can discover more vulnerabilities but also warns of emergent systemic failures from individual agent quirks.
rss · AIHOT 精选 · Aug 13, 01:20AIHOT 精选
标签: #multi-agent systems, #AI research, #AI safety, #Anthropic, #emergence
微软首发自研推理模型 MAI-Thinking-1 ⭐️ 8.0/10
Microsoft announced the release of its first self-developed reasoning model MAI-Thinking-1, now available on Microsoft Foundry.
rss · AIHOT 精选 · Aug 12, 16:00AIHOT 精选
标签: #Microsoft, #AI, #MAI-Thinking-1, #reasoning model, #machine learning
Research Gold 号称"100%人类撰写、绝不使用 AI",实则全程由 AI 驱动 ⭐️ 8.0/10
Investigation reveals Research Gold falsely claims human-written peer reviews but is entirely AI-driven, with fabricated reviewers and misappropriated identities.
rss · AIHOT 精选 · Aug 12, 05:41AIHOT 精选
标签: #AI ethics, #academic integrity, #peer review, #fraud, #research
Cursor 与 SpaceXAI 发布 Grok 4.6 ⭐️ 8.0/10
Grok 4.6 发布;在 Artificial Analysis 智能指数上追平 GPT-5.6 Sol。 SpaceXAI 与 Cursor 进入前沿大模型竞争,可能重塑 AI 编程与智能体工作流。 重点强化长时运行智能体与交互式视觉任务。
rss · AIHOT 精选 · Aug 12, 00:00AIHOT 精选
背景: 长时运行智能体是能持续数小时甚至数天完成目标的 AI 系统,而非只回答单个提示。Artificial Analysis 智能指数是一个 0-100 的复合基准,权重涵盖智能体工作、编程、通用能力与科学推理。SpaceXAI 是 SpaceX 于 2026 年吸收合并 xAI 后成立的实体。
参考链接
标签: #AI/ML, #Grok 4.6, #Cursor, #SpaceXAI, #LLM
附录
以下内容来自 AIHOT 日报,每天 08:00 北京时间发布
- AIHOT 日报 · 2026-08-16 — AI 生成书籍正淹没亚马逊,并拉低人类作者的单书收入
AI 生成书籍正淹没亚马逊,并拉低人类作者的单书收入 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-16
- AIHOT 日报 · 2026-08-15 — dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-15
- AIHOT 日报 · 2026-08-14 — 小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-14
- AIHOT 日报 · 2026-08-13 — xAI 发布 Grok 4.6,强化长时运行智能体能力
xAI 发布 Grok 4.6,强化长时运行智能体能力 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-13
- AIHOT 日报 · 2026-08-12 — NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务
NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-12
- AIHOT 日报 · 2026-08-11 — SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理
SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-11
- AIHOT 日报 · 2026-08-10 — Seedance 2.5 上线一周新增六种创意玩法
Seedance 2.5 上线一周新增六种创意玩法 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-10
- AIHOT 日报 · 2026-08-09 — 苹果 Mac 简体中文支持文档更新,“Apple 智能”阿里千问扩展现身
苹果 Mac 简体中文支持文档更新,“Apple 智能”阿里千问扩展现身 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-09
- AIHOT 日报 · 2026-08-08 — 谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时
谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-08
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-07
Qwen-Image-3.0-Pro 上线 Qwen Cloud — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-06
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-05
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-04
Grok 支持分析任意视频 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-03
德国法院裁定 AI 音乐生成器 Suno 侵犯版权,驳回合理使用抗辩 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-02
DeepSeek V4 Flash 0731 开源,登顶开源模型前三 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-08-01
Google DeepMind 发布 Gemini Robotics 2 物理 AI — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-31
Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-30
- AIHOT 日报 · 2026-07-29 — Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%
Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95% — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-29
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-28
xAI 发布 Grok CLI 并支持 /tutorial 命令 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-27
新报告揭示 OpenAI 在 Hugging Face 自主黑客事件中失控的严重程度 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-26
Anthropic 发布 Claude Opus 5 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-25
Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-24
腾讯设计 Agent 平台 Miora 全面开放 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-23
小红书 dots 模型获 IMO 2026 满分金牌 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-22
面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-21
Qwen3.8 开源发布,2.4T 参数模型上线 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-20
Claude Code v2.1.214 发布:修复权限绕过、添加 EndConversation 工具与多项 Bash 权限检查改进 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-19
Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头 — 点击查看完整日报
via AIHOT · https://aihot.virxact.com/daily/2026-07-18