觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-09-19 2 浏览 免费阅读

Qwen3.8-Omni-Flash 以低于谷歌 Gemini Flash 的价格,在多模态基准上与之匹敌

Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可处理音视频并自主调用工具,支持百万 token 上下文;音视频任务接近 Gemini 3.8 Flash,API 定价更低,并提供开源插件与实时交互工具。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-09-19 22:30:57

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

Qwen3.8-Omni-Flash is Qwen's first multimodal model built for AI agents. It processes audio and video together, draws conclusions, and uses tools on its own to edit vlogs, translate short videos, or summarize movies. The context window spans one million tokens. On audio-video tasks, Qwen says it comes close to matching Gemini 3.8 Flash. API pricing sits at $0.15 per million input tokens and $0.47 per million output tokens. Qwen estimates audio input at under $0.01 per hour, while 720p video with audio at one frame per second runs about $0.20, not counting response costs. For comparison, Gemini 3.8 Flash charges $0.75 for input and $3.75 for output per million tokens at its introductory rate, with prices set to double on January 1, 2027. The model is available through Qwen Studio , Qwen Cloud , and the API . The open-source Qwen-MM-Plugins add video editing, speaker recognition, PDF video notes, and reusable workflows to agents like Claude Code, Gemini CLI, and Qwen Code. Qwen-Live Harness enables real-time interaction using a camera and microphone. Ad Ad Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

中文翻译

Qwen3.8-Omni-Flash 是 Qwen 首个为 AI 智能体打造的多模态模型。

它同时处理音频和视频,得出结论,并自行使用工具来剪辑视频博客、翻译短视频或总结电影。

上下文窗口跨度达一百万 token。

在音视频任务上,Qwen 表示它接近匹配 Gemini 3.8 Flash。

API 定价为每百万输入 token 0.15 美元,每百万输出 token 0.47 美元。

Qwen 估计音频输入每小时低于 0.01 美元,而带音频的 720p 视频以每秒一帧运行约 0.20 美元,不计响应成本。

作为对比,Gemini 3.8 Flash 的输入收费为每百万 token 0.75 美元,输出为每百万 token 3.75 美元,这是其介绍性价格,价格将在 2027 年 1 月 1 日翻倍。

该模型可通过 Qwen Studio、Qwen Cloud 和 API 使用。

开源 Qwen-MM-Plugins 为 Claude Code、Gemini CLI 和 Qwen Code 等智能体添加视频编辑、说话人识别、PDF 视频笔记和可复用工作流。

Qwen-Live Harness 使用摄像头和麦克风实现实时交互。

核心信息

Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可处理音视频并自主调用工具,支持百万 token 上下文;音视频任务接近 Gemini 3.8 Flash,API 定价更低,并提供开源插件与实时交互工具。

  • Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可处理音视频并自主调用工具,支持百万 token 上下文;音视频任务接近 Gemini 3.8 Flash,API 定价更低,并提供开源插件与实时交互工具。
  • 原贴提到:Qwen3.8-Omni-Flash is Qwen's first multimodal model built for AI agents.
  • 来源:the-decoder.com

详细解读

这是什么信号

Qwen 推出 Qwen3.8-Omni-Flash,称其为首个为 AI 智能体打造的多模态模型。它不只做理解,还能同时处理音频与视频、得出结论,并自主调用工具完成剪辑视频博客、翻译短视频、总结电影等任务。上下文窗口达到一百万 token。更关键的是定价:API 每百万输入 token 0.15 美元、每百万输出 token 0.47 美元;音频输入每小时低于 0.01 美元,带音频的 720p 视频按每秒一帧约 0.20 美元,且不计响应成本。对照 Gemini 3.8 Flash 的输入 0.75 美元、输出 3.75 美元每百万 token,且其介绍性价格将在 2027 年 1 月 1 日翻倍,Qwen 明显在打性价比与 agent 工作流组合拳。

为什么重要

第一,多模态 agent 的成本结构被重新定义。过去音视频理解与工具调用往往分开计费、分开集成,现在一个模型加上插件就能覆盖从识别、翻译到编辑的链路。第二,价格锚点被拉低。Gemini 3.8 Flash 的输入定价是 Qwen 的 5 倍,输出定价是约 8 倍,若按 2027 年翻倍后的价格差距更大。对需要大规模跑音视频任务的产品来说,单位小时成本会直接决定能否商业化。第三,Qwen 用开源 Qwen-MM-Plugins 把视频编辑、说话人识别、PDF 视频笔记和可复用工作流接入 Claude Code、Gemini CLI、Qwen Code 等 agent,再用 Qwen-Live Harness 支持摄像头和麦克风实时交互,说明竞争已从单模型 benchmark 转向 agent 生态与工具链。

对谁有价值

最直接的是 AI 应用开发者与 agent 平台:需要在低成本下做视频摘要、短视频翻译、自动剪辑、会议或直播理解。其次是音视频内容团队与 MCN:可以把批量 vlog 编辑、字幕翻译、电影总结做成流水线。再次是成本敏感型企业与创业公司:在预算有限时,多模态能力从演示变成可跑量。产品经理也可据此重新评估多模态功能是否值得放入 roadmap。

可以怎么行动

先在 Qwen Studio、Qwen Cloud 或 API 上用自有音视频样本做小规模测试,重点验证音频理解、长视频摘要、工具调用稳定性与响应成本,而不是只看基准分数。然后把 Qwen-MM-Plugins 接入现有 agent 工作流,测试视频编辑、说话人识别、PDF 视频笔记等任务能否减少人工环节。对正在使用 Gemini 3.8 Flash 的团队,建议做并行成本与效果对比,特别要计入 2027 年 1 月 1 日价格翻倍的影响,提前准备迁移或混合路由方案。若要做实时交互,可评估 Qwen-Live Harness 的摄像头与麦克风链路。

风险或限制

Qwen 称音视频任务接近 Gemini 3.8 Flash,但这是厂商说法,仍需第三方基准和真实业务任务验证。价格数字明确,但视频成本不计响应成本,实际总成本会更高;大规模调用还要算存储、转码、重试和人工复核。多模态模型在长视频、嘈杂音频、多说话人、跨语言场景下仍可能出现幻觉或漏检。工具自主调用越强,权限、数据隐私与合规风险越大,尤其涉及用户视频和音频。开源插件的成熟度、维护频率和企业级支持也需评估。Gemini 未来是否调整定价或能力仍不确定,不能假设当前价格优势永久存在。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《Qwen3.8-Omni-Flash 以低于谷歌 Gemini Flash 的价格,在多模态基准上与之匹敌》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

Qwen3.8-Omni-Flash 以低于谷歌 Gemini Flash 的价格,在多模态基准上与之匹敌主要讲什么?

Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可处理音视频并自主调用工具,支持百万 token 上下文;音视频任务接近 Gemini 3.8 Flash,API 定价更低,并提供开源插件与实时交互工具。

这篇文章最值得关注的要点是什么?

Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可处理音视频并自主调用工具,支持百万 token 上下文;音视频任务接近 Gemini 3.8 Flash,API 定价更低,并提供开源插件与实时交互…;原贴提到:Qwen3.8-Omni-Flash is Qwen's first multimodal model built for AI agents.;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI副业、AI工具专题里阅读。 关联原因:这篇内容命中「Agent、智能体」等主题信号。;这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「工具、自动化、模型」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 纽约时报诉讼文件披露:微软高管称 AI 抓取是“人类历史上最大规模的劳动力盗用” 下一篇 Google DeepMind 的 Dream-RSI:让 AI 智能体通过“做梦”回放过去的尝试来改进