OpenAI 为 ChatGPT 推出 canvas 写作与编程新界面
OpenAI 官方宣布为 ChatGPT 推出 canvas,一种新的写作与编程交互方式。当前 feed 仅提供标题,未包含更多功能细节。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
OpenAI 官方宣布为 ChatGPT 推出 canvas,一种新的写作与编程交互方式。当前 feed 仅提供标题,未包含更多功能细节。
OpenAI 推出 Realtime API,开发者现在可以在自己的应用中构建快速的语音到语音(speech-to-speech)体验。
OpenAI 宣布开发者现在可以使用图像和文本微调 GPT-4o,以提升模型的视觉能力。
推荐理由:官方宣布开放图像微调入口,读者可据此判断视觉能力定制是否进入可落地阶段。
OpenAI 在 API 中推出 Prompt Caching,对模型近期已处理过的输入自动提供折扣,降低重复输入的调用成本。
推荐理由:说明了缓存如何自动降低近期已见输入的成本,读者可据此判断调用开销的变化。
Hugging Face 在 Transformers 中推出跨模型统一的工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch、Llama 等模型间移植,几乎无需模型特定改动,并配套辅助功能与完整文档示例。
推荐理由:文章给出统一工具调用 API 的设计取舍与完整可运行示例,读者可直接迁移方法到自己的项目中。
OpenAI 在 API 中推出 Structured Outputs,模型输出现在能够可靠地遵循开发者提供的 JSON Schema。
OpenAI 宣布正在测试 SearchGPT,这是一个临时原型,提供快速及时的答案,并附带清晰、相关的来源。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)现已在 Hugging Face Hub 上线并支持 🧨 Diffusers,同时提供 SD3 Dreambooth 和 LoRA 训练脚本。
推荐理由:原文给出显存与速度的实测对照表,读者可据此选择适合自己硬件的运行方案。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体之外新增两种能基于过往观察迭代的智能体(ReactCodeAgent 与 ReactJsonAgent),并加入社区分享功能。
推荐理由:原文给出组件设计与基准结果,读者可据此评估开源智能体框架的实际竞争力。
OpenAI 官方宣布推出 ChatGPT 和 Whisper 的 API。
OpenAI 宣布让用户无需注册即可直接开始使用 ChatGPT,以降低体验 AI 的门槛。
Hugging Face 发布 Cosmopedia,一个用 Mixtral-8x7B-Instruct-v0.1 生成、含超 3000 万文件和 25 billion tokens 的合成数据集,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。
推荐理由:原文拆解了从几千到千万级样本的提示词工程方法,可迁移给要做大规模预训练数据的团队。
OpenAI 官方宣布正在测试 ChatGPT 的记忆能力,使其能记住用户讨论过的内容,从而让后续对话更有帮助;用户可以掌控 ChatGPT 的记忆。
Hugging Face 官方博客宣布推出 Latent Consistency LoRAs(LCM LoRA),通过只训练少量 LoRA 适配器而非完整蒸馏模型,让 Stable Diffusion 和 SDXL 以 4 步完成推理,替代原本的 25 到 50 步。
推荐理由:给出了各硬件的实测耗时对比,读者可据此判断自己设备上能否跑近实时生成。
OpenAI 在 DevDay 上宣布多项新模型与开发者产品,包括具备 128K context 且价格更低的 GPT-4 Turbo、新版 Assistants API、GPT-4 Turbo with Vision 以及 DALL·E 3 API 等。
推荐理由:原文列出了一次开发者大会上的多项模型与API更新,可据此了解OpenAI当时的产品线变化方向。
OpenAI 推出 GPTs,用户可以创建自定义版本的 ChatGPT,将指令、额外知识以及任意组合的技能结合在一起。
推荐理由:原文点明了自定义 ChatGPT 的构成要素,读者可据此理解它与普通对话的差别。
OpenAI 官方宣布 ChatGPT 现在可以看、听和说,即支持图像输入、音频理解与语音输出能力。
OpenAI 发布 ChatGPT Enterprise,称其提供企业级安全与隐私保护,以及迄今最强大的 ChatGPT 版本。
Hugging Face 宣布在自身生态中集成 Meta 的 Code Llama 模型家族,包含 7B、13B、34B 三种参数规模,以及 Python 专精版和指令微调版,采用与 Llama 2 相同的宽松社区许可并可商用。
推荐理由:原文给出模型规格、上下文窗口扩展方法和多语言榜单成绩,便于评估其在代码任务上的定位。
Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法把模型量化到 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线,同时支持 Nvidia 与 RoCm AMD GPU。
推荐理由:原文给出了量化位宽、显存与延迟的实测对比,读者可据此判断能否在自己的 GPU 上跑起大模型。