Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,高性能计算芯片 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B AI能操作其他工具延迟平均降低 57%,已代码公开可免费使用支持 llama.cpp 和 SGLang
模型动态
每周更新大模型排名、能力对比与实测数据。追踪 GPT、Claude、Gemini 及国产大模型最新动态。
阿里巴巴正式推出 Qwen-UI-能自动完成任务的AI助手,一个以真实世界为中心的 GUI 能自动完成任务的AI助手基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境
Liquid AI 发布基于压缩模型让它跑得更快感知让大模型教小模型的瘦身技术(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%
Anthropic 发布 Claude 4 系列,支持超大一次能记住多少内容与更强的 agent 能力,在代码重构和长文档分析场景表现突出
Google 推出 Gemini 3,强化原生能看图、听声音、懂文字的综合能力与长视频理解能力,并面向开发者开放更细粒度的视频分析 调用接口
Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 能自动完成任务的AI助手更精准
通义千问兑现承诺,代码公开可免费使用 Qwen3.8 系列模型。其中 Qwen3.8-27B 为原生能看图、听声音、懂文字的综合能力稠密模型,仅 27B 参数即 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布
小红书技术代码公开可免费使用 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音能看图、听声音、懂文字的综合能力理解,并针对复杂推理和长程 能自动完成任务的AI助手 任��优化
智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得代码公开可免费使用第一。模型在白盒代码审查等安全任务中表现持平Mythos 5,并在CyberGym测试中得分84.5%。GLM-5.3即日起上线ZCode、AutoClaw等工具,调用接口很快上线,完整模型权重将在两周内代码公开可免费使用
DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 一次能记住多少内容及低/高/最大三档推理强度,更侧重编码、工具调用与能自动完成任务的AI助手工作流,仍保持 MIT 代码公开可免费使用协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景
智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得代码公开可免费使用第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后代码公开可免费使用,即日起上线ZCode、AutoClaw等工具
阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次代码公开可免费使用。模型总参数 2.4T,每个 文字处理单位 激活 95B,原生支持 262,144 文字处理单位 上下文并可扩展至 1,010,000 文字处理单位
我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用
Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行能自动完成任务的AI助手与交互式视觉任务,在多项能自动完成任务的AI助手编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行能自动完成任务的AI助手及更复杂的交互式与视觉工作能力。该模型在多项能自动完成任务的AI助手编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该代码公开可免费使用模型为 30B 总参数、3B 激活参数的多位专家协作模式架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 调用接口 接入能自动完成任务的AI助手工作流
NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的代码公开可免费使用 30B 多位专家协作模式(多位专家协作的模式)模型,专为常驻能自动完成任务的AI助手设计。相比同类代码公开可免费使用模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户针对性训练优化以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行
蚂蚁百灵代码公开可免费使用 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本
SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数能看图、听声音、懂文字的综合能力模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 一次能记住多少内容
推出 Muse Glimmer,一款开放权重、300 亿参数的模型,专为本地、常驻运行的能自动完成任务的AI助手工作流优化。 与同尺寸领先模型相比,Muse Glimmer 在关键能自动完成任务的AI助手用例和标准化的能力考试中表现出色,并设计为完全在消费级硬件(如 Mac 或配备高性能 高性能计算芯片 的 PC)上运行。 秉承我们长期分享基础 AI 研究的传统,我们以宽松的 Apache 2.0 许可证发布模型权重
1/ 今天有个重大消息:我们很快将发布 Muse Spark 1.2 的代码公开可免费使用权重版本。 同时,我们还将发布 Muse Glimmer--一个 30B 参数的能自动完成任务的AI助手模型,采用 Apache 2.0 协议代码公开可免费使用权重。Muse Glimmer 可在 24GB 显存上运行,且不损失能自动完成任务的AI助手可靠性。🧵
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,用于授权的漏洞研究、漏洞验证和安全测试。该模型旨在应对网络防御窗口不断收窄的挑战,为安全研究人员提供专门工具
NVIDIA 发布代码公开可免费使用端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的代码公开可免费使用全双工模型,通过独立输出通道及预置"保持"话术避免 调用接口 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 高性能计算芯片,目前无托管 调用接口
蚂蚁百灵正式代码公开可免费使用新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 多位专家协作的模式 架构,并提供 FP8、FP4、INT4 等多个版本
谷歌 DeepMind 联合多家机构推出 WeatherNext Cyclones 气旋预测模型,在路径、强度和风场结构预测精度上达到业界领先。该模型将有���预报时长从 2 天延长至 3 天,平均提前 24 小时,预测量级约相当于 10 年气象进展
NVIDIA 发布 Cosmos 3,一个基于混合 AI核心技术架构 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测
ChatGPT 推出改进版 GPT-5.6 Sol,提升准确性与一致性,同时扩大免费用户访问权限。免费用户还可无限次使用 GPT-5.6 Luna 进行日常对话
NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用
阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张
@bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。 一个统一的视频、音频、图像和动作预测能看图、听声音、懂文字的综合能力模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练
字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现"边看、边听、边说"的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地
商汤发布代码公开可免费使用模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub
今天,我们发布了 Ling-3.0-flash 的代码公开可免费使用权重。🎉 官方 BF16 和 FP8 压缩模型让它跑得更快版本现已可用,您可以根据自己的硬件、性能要求和部署需求选择最合适的版本
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用通过试错来学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于AI对话助手 Hy3 与 多位专家协作的模式 架构,融合高精度识别与语义理解。其在代码公开可免费使用评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 调用接口,元宝 App 首发并免费开放
商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一能看图、听声音、懂文字的综合能力模型,仅 8B-MoT 参数即可达到商业内部开发不公开模型的生成与编辑质量
MiniMax 正式代码公开可免费使用新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次代码公开可免费使用 Qwen-Max 级权重,开放权重将于下周发布
DeepSeek 发布代码公开可免费使用模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列代码公开可免费使用模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 调用接口
MiniMax 正式推出全能能看图、听声音、懂文字的综合能力生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日代码公开可免费使用模型权重,以支持代码公开可免费使用社区并加速硬件兼容
🚀 DeepSeek-V4-Flash 官方 调用接口 现已上线公测! 🔷 我们大幅升级了其 能自动完成任务的AI助手 能力--标准化的能力考试分数现已远超 V4-Pro-Preview。查看下方巨大的性能飞跃!👇 🔷 官方 V4-Flash 现已原生支持 Responses 调用接口 格式,并已完全适配 Codex! 查看我们官方 调用接口 文档中的配置详情:https://api-docs.deepseek.com/quick_start/agent_integrations/codex
One brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力
Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务
OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流
Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长
我们在 调用接口 中引入了两种新的转录模型: • GPT-Live-Transcribe:专为低延迟实时转录而构建。 • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。 两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音