跳到正文

全部动态

今日 6 条
8月21日周五
  1. Microsoft Research38

    微软 Skala 1.1 发布:训练数据增 2.5 倍,并集成进 CP2K 等主流 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。

8月14日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的高效模型,距 Gemini 3.6 Flash 发布仅三周。

    推荐理由:原文给出多项基准对比与定价,读者可据此评估它相对 3.6 Flash 的实际提升幅度。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布手语转文字模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文字(SL2T)模型,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中提供美式手语(ASL)转英文的签名输入功能,后续将支持更多设备与语言。

    推荐理由:原文交代了手语翻译相比语音转写的两类核心难点,以及用姿态关键点替代原始视频的隐私设计,便于理解该模型的技术取舍。

8月11日周二
8月10日周一
8月6日周四
  1. Google DeepMind78

    Google DeepMind 开源 WeatherNext 气旋预报模型,三天预报精度媲美旧模型两天

    Google DeepMind 在 Nature 发文称其 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到 SOTA,三天预报精度相当于旧模型的两天,领先幅度超过 24 小时,约相当于十年气象学进展。

    推荐理由:原文给出了模型在低分辨率下取得高精度这一反直觉发现及其开放权重的入口,读者可据此评估其对现有预报工作流的可迁移价值。

8月4日周二
  1. Mistral AI61

    Mistral AI 开源 3B 多模态安全分类模型 Shieldstral

    Mistral AI 以 Apache 2.0 协议开源 3B 多模态安全分类模型 Shieldstral,它把内容审核建模为二元问答任务,推理时用自然语言写入策略即可返回校准的连续安全分数,无需重训,统一处理文本与图像。

    推荐理由:原文说明了把内容审核改写成自然语言问答的做法,读者可据此理解它如何在不重训的前提下适配不同产品策略。

  2. Microsoft Research74

    Microsoft Research 开源可扩展智能体框架 Orchard

    Microsoft Research 开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体,并同步发布训练数据与评测方法。

    推荐理由:原文给出三个领域的训练配方与具体分数,读者可据此评估小参数开源模型在真实任务上的能力边界。

7月31日周五
  1. Microsoft Research74

    Microsoft Research 发布 Echoverse:面向计算机使用智能体的深度可演化训练环境

    Microsoft Research 发布 Echoverse,一套面向计算机使用智能体的深度可演化训练环境,包含十个深度领域世界和两个能力世界,并开源其中四个世界的代码、数据与数据库接地验证器。

    推荐理由:原文用对照实验说明深度与多样性比环境数量更能带来迁移,可为构建计算机使用智能体训练环境提供方法参考。

7月30日周四
  1. Google DeepMind56

    Google DeepMind 发布音乐生成模型 Lyria 3.5 并上线 Google Flow Music

    Google DeepMind 宣布音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线。新版本在音乐性、歌词、人声和创作控制四方面升级:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度和结构意识提升,人声更真实且情感更细腻、发音更清晰,并支持更方便地控制输出的节奏和时长。

7月21日周二
7月17日周五
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,通过 CodeMender 以限量试点方式先向政府和可信伙伴开放。

    推荐理由:原文说明了轻量模型在代码安全场景相对大模型的成本与调用优势,以及受限开放策略的考量。

7月16日周四
7月15日周三
  1. Hugging Face Blog81

    Hugging Face 发布 Thinking Machines 的多模态模型 Inkling 及 Inkling-Small

    Hugging Face 上线 Thinking Machines Lab 的 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 decoder-only MoE 模型,原生支持图像、文本、音频输入与 1M 上下文,在 45 trillion token 上训练。

    推荐理由:原文给出架构细节与各部署配置的显存开销,读者可据此判断自己硬件能否跑起来。

7月8日周三
7月2日周四
  1. Mistral AI74

    Mistral AI 发布 Leanstral 1.5 形式化验证模型

    Mistral AI 发布 Leanstral 1.5,一款 Apache-2.0 许可、119B 总参数 6B 激活参数的免费模型,权重已上线 Hugging Face 并提供免费 API 端点 leanstral-1-5。

    推荐理由:原文给出基准成绩、成本对比和测试时扩展曲线,读者可据此判断其在形式化验证任务上的性价比与能力边界。

7月1日周三
6月30日周二
  1. Google Research67

    Google Research 发布表格数据零样本基础模型 TabFM

    Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参调优和特征工程,单次前向传播即可在未见过的表格上生成预测。

    推荐理由:原文说明了混合注意力架构与合成数据训练如何替代传统特征工程和调参流程,便于评估其对现有工作流的替代空间。

6月27日周六
6月11日周四
  1. Google DeepMind74

    Google DeepMind 开源实验性扩散文本模型 DiffusionGemma,推理提速最高 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍,单张 NVIDIA H100 可达 1000+ tokens per second,NVIDIA GeForce RTX 5090 可达 700+ tokens per second。

    推荐理由:原文给出了速度、显存与质量取舍的具体数据,读者可据此判断它是否适合本地交互场景。

6月9日周二
5月22日周五
  1. Mistral AI74

    Mistral 发布 128B 开源权重模型 Mistral Medium 3.5 并推出 Vibe 远程智能体

    Mistral 发布 Mistral Medium 3.5,一个 128B 稠密、256k 上下文窗口的旗舰模型,以修改版 MIT 协议开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,最少四张 GPU 即可自托管。

    推荐理由:原文给出了模型规模、价格与自托管门槛,读者可据此评估其在编码智能体场景的可用性。

5月18日周一
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。

    推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码能力

    Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,称其为目前最强的智能体与编码模型,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍,成本常低于其一半。

    推荐理由:原文给出多项基准分数与速度成本数据,读者可据此判断它在智能体与编码场景中的定位。

4月30日周四
  1. Google DeepMind74

    Google DeepMind 推出 AI co-clinician 医疗研究计划

    Google DeepMind 宣布推出 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体辅助患者的三方诊疗模式。在 98 个真实初级医疗查询的盲测中,该系统在 97 例里零关键错误,医生在对照评估中更偏好其回答;在 OpenFDA RxQA 药物问答基准上,开放式提问场景表现超过其他前沿模型。

    推荐理由:原文给出了评测方法与具体结果,读者可据此判断该系统当前能力边界与适用场景。

4月16日周四
4月13日周一
4月3日周五
3月25日周三
3月24日周二
  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数量 4B,基于 Ministral 3B 构建,支持 9 种语言(英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语、阿拉伯语)的自然情感语音生成。

    推荐理由:原文给出了架构组成、延迟数据和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的可用性。

3月17日周二
2月5日周四
12月9日周二
12月3日周三
7月30日周三
7月15日周二
  1. Mistral AI75

    Mistral AI 开源 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个尺寸,均以 Apache 2.0 许可开源,也可通过 API 调用,API 定价 $0.001 per minute 起。

    推荐理由:原文对比了开源与闭源语音方案的取舍,并给出价格与基准数据,便于评估其部署性价比。

7月11日周五