跳到正文

#多模态

今日 1 条
今天9月30日周三
9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,从缩小搜索空间到选出候选化合物仅用一个周末,湿实验验证中排名最高的化合物产生了最大的预期细胞状态转变。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,读者可了解 AI 参与药物发现的具体流程与验证结果。

9月26日周六
9月25日周五
9月24日周四
9月23日周三
9月21日周一
9月16日周三
9月15日周二
9月3日周四
9月2日周三
  1. Google DeepMind73

    Gemini 推出 agentic video understanding 视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic video understanding,通过让模型主动调用原生视频工具按需检索画面、音频与字幕,替代固定帧率的静态处理。

    推荐理由:原文给出了成本、token 与准确率三项量化变化及启用方式,读者可据此评估它对长视频分析工作流的实际影响。

8月28日周五
  1. Google Research61

    Google Earth AI 推出 planetary prediction engine 自动化地理空间建模

    Google Research 介绍 Google Earth AI 的实验性能力 planetary prediction engine(PPE),可从自然语言查询出发自主完成数据发现、特征工程、模型训练与评估,把复杂地理空间预测模型的构建时间从数周缩短到数分钟。

    推荐理由:原文给出了三阶段架构与四类任务的具体指标,读者可据此判断自动化地理空间建模相对人工流程的实际增益。

  2. Google DeepMind62

    Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延展与首尾帧插值等视频控制能力

    Google DeepMind 宣布推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 面向开发者开放,使 Omni 1.1 达到可用于专业生产的状态。

    推荐理由:原文列出了场景延展、首尾帧插值、360p 快速原型和 4K 升档等具体能力与参数,可据此评估其对生成视频工作流的改动。

8月27日周四
  1. Google DeepMind74

    Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe

    Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe,可将原始音频直接转为准确、格式化的文本,已在 Gemini app 和 Android 的 Rambler 等功能中使用,现通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 向开发者开放。

    推荐理由:原文给出了 WER、延迟等量化指标和 Chirp 3 对比,读者可据此评估其在真实场景的可用性。

8月26日周三
8月22日周六
  1. Google Research51

    Google Research 发布可穿戴数据候选生物标志物优先级排序 AI 工具

    Google Research 推出 Biomarker Discovery Framework,一个在人类监督下把候选生物标志物优先级排序组织成迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理,在三个队列共 9,279 参与者观测上识别出 41 个心理健康和 25 个代谢结局的候选数字生物标志物。

8月21日周五
  1. Google Research45

    Google Research:ME-POIs 如何用移动性数据让语言模型更懂地点

    Google Research 提出 ME-POIs 框架,将匿名移动模式作为输入特征融入语言模型的地点表示,在未见地点上将访问意图预测相对提升 81.9%、价格等级分类提升 75.1%、繁忙度估计准确率提升 24.7%。该框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,将 Gemini 等模型的语言嵌入与移动性向量对齐,并用邻近繁忙地点的访问模式缓解数据稀疏的长尾问题。

8月17日周一
8月13日周四
  1. Microsoft Research42

    MindTopo:微软研究院推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,图像与视频生成工具也难以在动作序列中稳定保持拓扑关系。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布手语转文字模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文字(SL2T)模型,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中提供美式手语(ASL)转英文的签名输入功能,后续将支持更多设备与语言。

    推荐理由:原文交代了手语翻译相比语音转写的两类核心难点,以及用姿态关键点替代原始视频的隐私设计,便于理解该模型的技术取舍。

  2. Google Research74

    Google 发布 AMIE (Video) 实时视频问诊配置

    Google Research 发布基于 Gemini 和 Project Astra 构建的 AMIE (Video),可进行同步临床视频问诊,实时感知非语言线索、引导模拟体格检查并完成诊断推理。

    推荐理由:原文给出了三智能体架构与随机对照研究设计,读者可据此理解音视频临床问诊如何兼顾实时对话与深度推理。

8月10日周一
8月6日周四
  1. Google DeepMind78

    Google DeepMind 开源 WeatherNext 气旋预报模型,三天预报精度媲美旧模型两天

    Google DeepMind 在 Nature 发文称其 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到 SOTA,三天预报精度相当于旧模型的两天,领先幅度超过 24 小时,约相当于十年气象学进展。

    推荐理由:原文给出了模型在低分辨率下取得高精度这一反直觉发现及其开放权重的入口,读者可据此评估其对现有预报工作流的可迁移价值。

8月4日周二
  1. Mistral AI61

    Mistral AI 开源 3B 多模态安全分类模型 Shieldstral

    Mistral AI 以 Apache 2.0 协议开源 3B 多模态安全分类模型 Shieldstral,它把内容审核建模为二元问答任务,推理时用自然语言写入策略即可返回校准的连续安全分数,无需重训,统一处理文本与图像。

    推荐理由:原文说明了把内容审核改写成自然语言问答的做法,读者可据此理解它如何在不重训的前提下适配不同产品策略。

7月30日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑进行对话、理解物理世界并规划多步任务,再将运动执行交给下层 VLA 模型。

    推荐理由:原文给出进度分类与关键时刻定位的具体指标,读者可据此理解视频理解如何转化为机器人任务编排能力。

  2. Google DeepMind56

    Google DeepMind 发布音乐生成模型 Lyria 3.5 并上线 Google Flow Music

    Google DeepMind 宣布音乐生成模型 Lyria 3.5 今日在 Google Flow Music 上线。新版本在音乐性、歌词、人声和创作控制四方面升级:可生成更丰富自然的旋律结构,歌词质量与提示词遵循度和结构意识提升,人声更真实且情感更细腻、发音更清晰,并支持更方便地控制输出的节奏和时长。

7月28日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制

    Google DeepMind 发布 Gemini Robotics 2,包含三个模型:Gemini Robotics 2 视觉-语言-动作(VLA)模型可控制整个人形机器人从脚到指尖的全身动作并实现双手灵巧操作。

    推荐理由:原文拆解了三个模型的分工与开放入口,读者可据此判断机器人智能如何从上半身扩展到全身控制。

7月27日周一
7月23日周四
  1. Google Research62

    Google Research 发布 SymptomAI 论文:万人规模研究评估对话式症状评估智能体

    Google Research 发布论文 SymptomAI,介绍一项 n=13,917 的随机全美研究,参与者向五种不同问诊策略的 Gemini Flash 2.0 SymptomAI 智能体描述症状并获得鉴别诊断(DDx)。

    推荐理由:研究给出了万人规模真实问诊对照与可穿戴数据交叉验证方法,可参考其评估设计思路。

7月22日周三
7月16日周四
7月15日周三
  1. Hugging Face Blog81

    Hugging Face 发布 Thinking Machines 的多模态模型 Inkling 及 Inkling-Small

    Hugging Face 上线 Thinking Machines Lab 的 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 decoder-only MoE 模型,原生支持图像、文本、音频输入与 1M 上下文,在 45 trillion token 上训练。

    推荐理由:原文给出架构细节与各部署配置的显存开销,读者可据此判断自己硬件能否跑起来。

7月13日周一
7月9日周四
  1. Google Research62

    Google Research 发布 SensorFM 可穿戴健康数据基础模型

    Google Research 发布大型传感器基础模型 SensorFM,用 500 万名同意参与者、超过 1 万亿分钟的多模态传感器信号做自监督预训练,学习可迁移到心血管、代谢、睡眠和心理健康的通用生理表征。

    推荐理由:原文给出了预训练规模与下游任务收益的对应关系,读者可据此判断通用表征在可穿戴健康场景的迁移空间。

7月8日周三