跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 81–96 条 · 共 96 条
11月19日周三
  1. Google DeepMind92

    Google DeepMind 发布 Gemini 3 系列模型

    Google DeepMind 发布 Gemini 3,先推出 Gemini 3 Pro preview,并同步上线 Gemini app、AI Studio、Vertex AI、Gemini CLI 及 Search 的 AI Mode,首次在 Search 第一天接入。

    推荐理由:官方给出了各基准的具体分数与开放入口,读者可据此评估其相对 2.5 Pro 的实际提升。

  2. Google Research74

    Google 推出 Generative UI:Gemini 应用与 AI Mode 上线动态界面实验

    Google Research 发布论文并推出 Generative UI,让模型针对任意提示词动态生成网页、游戏、工具和应用等交互界面,该能力以 dynamic view 和 visual layout 两项实验形式在 Gemini 应用上线。

    推荐理由:原文说明了实现所需的三项关键设计和评测对比口径,读者可据此判断生成式 UI 目前的能力边界。

11月17日周一
  1. Google DeepMind73

    Google DeepMind 发布 WeatherNext 2 天气预报模型

    Google DeepMind 和 Google Research 发布 WeatherNext 2 天气预报模型,预报生成速度提升 8x、分辨率可达 1 小时,单次输入可生成数百种可能情景,每个预测在单个 TPU 上耗时不到一分钟。

    推荐理由:原文说明了新模型的建模思路和落地入口,读者可据此判断它如何进入现有天气查询与业务流程。

11月13日周四
10月28日周二
9月4日周四
  1. Hugging Face Blog73

    Google 发布 EmbeddingGemma 多语言嵌入模型

    Google 发布 EmbeddingGemma(google/embeddinggemma-300m),一款 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200 MB,在 MTEB 上是 500M 以下排名最高的纯文本多语言嵌入模型。

    推荐理由:给出了架构改动、多框架接入方式和微调脚本,读者可据此判断如何在端侧 RAG 中落地该模型。

6月26日周四
  1. Hugging Face Blog81

    Gemma 3n 在开源生态全面开放可用

    Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama、Google AI Edge 等主流开源库开放可用,原生支持图像、文本、音频和视频输入。

    推荐理由:原文给出了模型规格、显存需求和各库接入方式,读者可据此判断能否在自己的设备上跑起来。

3月12日周三
  1. Hugging Face Blog84

    Google 发布 Gemma 3:多模态、多语言、128k 上下文的开源 LLM

    Google 发布 Gemma 3 系列开源模型,包含 1B、4B、12B、27B 四种参数规模,提供预训练与指令微调版本,上下文窗口最高达 128k tokens,支持 140+ 语言,4B/12B/27B 版本可处理图文输入。

    推荐理由:原文拆解了长上下文、多模态与多语言三项技术改进的具体做法,便于理解开源模型的能力来源。

2月21日周五
  1. Hugging Face Blog65

    Google 发布多模态视觉语言编码器 SigLIP 2

    Google 发布多模态视觉语言编码器家族 SigLIP 2,在 sigmoid loss 基础上加入解码器、Global-Local Loss 和 Masked Prediction Loss 等辅助训练目标,以提升语义理解、定位与稠密特征能力。

    推荐理由:文章拆解了从 SigLIP 到 SigLIP 2 的训练目标演进,读者可据此理解辅助损失如何改进视觉编码器。

10月23日周三
7月31日周三
6月27日周四
  1. Hugging Face Blog78

    Hugging Face 介绍 Google 新开放模型 Gemma 2 的技术细节与生态集成

    Google 发布 Gemma 2 系列开放 LLM,Hugging Face 与 Google 合作完成生态集成,Hub 上提供 4 个开放权重模型(9B 与 27B 各含 base 和指令微调版本),上下文长度 8192 tokens,27B 版本训练数据达 13 trillion tokens、9B 版本 8 trillion tokens。

    推荐理由:详细拆解了滑动窗口注意力、软上限、知识蒸馏和模型合并等技术细节,便于读者理解其性能提升来源。

5月14日周二
  1. Hugging Face Blog65

    Hugging Face 介绍 Google PaliGemma 开源视觉语言模型系列

    Hugging Face 博客介绍 Google 发布的 PaliGemma 视觉语言模型家族,其架构由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器经线性适配器组合而成,可接收图像与文本并输出文本。

    推荐理由:详细拆解了三类检查点的用途差异与分辨率取舍,可帮助读者按任务选型并直接上手微调。

2月21日周三