觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-08-24 2 浏览 免费阅读

阿里巴巴 Wan3.0:从文本、图像和文档生成最长30秒AI视频

阿里巴巴视频生成模型 Wan3.0 进入公测,支持文本、PDF、网页、PPT 输入,可生成最长30秒视频,并同时处理多模态内容。

SOURCE / AI小生意项目库 MIN / 4 ACCESS / 免费阅读 POST / 2026-08-24 23:35:03

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

Alibaba's video generation model Wan3.0 is now available in beta. It produces videos up to 30 seconds long and accepts text, PDFs, web pages, and PowerPoint files as input. That doubles the video length compared to its predecessor, Wan2.5 . The model also recommends the best video length based on the user's prompt and includes an extension tool to make existing videos longer. Wan3.0 processes text, images, video, and audio at the same time. A single prompt can include up to ten images, five videos, and five audio clips. Web pages and documents like PDFs or PowerPoint presentations also work as input sources, turning static data into dynamic video. Ad AI-generated videos often suffer from visual drift and distortion, especially in faces and user interfaces. Wan3.0 aims to fix that by keeping details from reference material like characters, props, and spatial layouts more consistent, according to Alibaba. Ad Wan3.0 is available through the wan.video website , Alibaba Cloud Model Studio , or via API on Qwen Cloud . There are two tiers: a Standard version, currently at a 30 percent discount, and a faster Prime version. Alibaba is pitching Wan3.0 for a wide range of uses, from speeding up film production to generating short dramas and social media clips for content creators. Businesses could turn text and images into marketing and training videos, while tech developers could use it to produce realistic simulation footage for training autonomous vehicles and robotics systems. Ad The launch comes as Alibaba ramps up AI spending. The company just announced the largest share sale by a Hong Kong-listed company to fund its AI push, and last week reported a 75 percent year-over-year drop in quarterly profit driven by sharply higher AI investments. Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.

中文翻译

阿里巴巴的 Wan3.0 从文本、图像和文档生成最长 30 秒的 AI 视频。

阿里巴巴的视频生成模型 Wan3.0 现已进入测试阶段。它可生成最长 30 秒的视频,并支持文本、PDF、网页和 PowerPoint 文件作为输入。与上一代 Wan2.5 相比,视频长度翻倍。该模型还会根据用户的提示推荐最佳视频长度,并包含一个扩展工具,可将现有视频延长。Wan3.0 同时处理文本、图像、视频和音频。单个提示最多可包含十张图像、五个视频和五个音频片段。网页和 PDF 或 PowerPoint 演示文稿等文档也可作为输入源,将静态数据转化为动态视频。广告 AI 生成的视频经常出现视觉漂移和失真,尤其是在面部和用户界面方面。据阿里巴巴称,Wan3.0 旨在通过保持角色、道具和空间布局等参考材料的细节更加一致来解决这个问题。广告 Wan3.0 可通过 wan.video 网站、阿里云模型工作室或通过 Qwen Cloud 上的 API 使用。有两个版本:标准版(目前有 30% 折扣)和更快的 Prime 版。阿里巴巴将 Wan3.0 定位用于广泛用途,从加快电影制作到为内容创作者生成短剧和社交媒体片段。企业可以将文本和图像转化为营销和培训视频,而技术开发者可以使用它生成逼真的模拟画面,用于训练自动驾驶车辆和机器人系统。广告 该发布正值阿里巴巴加大 AI 投入之际。该公司刚刚宣布了香港上市公司的最大规模股票出售,以资助其 AI 发展,上周还报告称,由于 AI 投资大幅增加,季度利润同比下降 75%。订阅 THE DECODER 获取无广告阅读、每周 AI 通讯、我们独家的 “AI Radar” 前沿报告(每年六次)、完整存档和评论区的访问权。

核心信息

阿里巴巴视频生成模型 Wan3.0 进入公测,支持文本、PDF、网页、PPT 输入,可生成最长30秒视频,并同时处理多模态内容。

  • 阿里巴巴视频生成模型 Wan3.0 进入公测,支持文本、PDF、网页、PPT 输入,可生成最长30秒视频,并同时处理多模态内容。
  • 原贴提到:Alibaba's video generation model Wan3.0 is now available in beta. It pro
  • 来源:the-decoder.com

详细解读

信号解读:阿里巴巴发布 Wan3.0 视频生成模型,标志着国产 AI 视频生成能力在输入模态和视频长度上实现关键突破。与上一代相比,视频长度从 15 秒翻倍至 30 秒,且支持文本、PDF、网页、PPT 等多种输入源,能够将静态文档转化为动态视频,这不仅是技术升级,更是产品定位向内容生产工具链的延伸。

为什么重要:视频生成是 AIGC 竞争最激烈的赛道之一。Wan3.0 的多模态输入和长视频能力,使其在短视频制作、营销内容、培训材料等领域具备可落地性。同时,阿里巴巴正大幅加码 AI 投入,虽然短期利润承压,但 Wan3.0 的商业化试图建立可持续的 AI 业务闭环。

对谁有价值:内容创作者可利用其将文本脚本快速转化为视频片段;企业市场团队可将产品文档和图文资料直接生成宣传视频;开发者可通过 API 集成到自有应用中,尤其适用于对视频时长和一致性要求较高的场景(如数字人、模拟训练)。

行动建议:建议创作者先通过 wan.video 官网体验标准版,重点测试其文档输入和延长功能,评估是否满足日常产出效率;技术团队可申请 API 权限,验证在自动化视频生产流水线中的稳定性和成本。企业用户应关注其版权和内容安全政策,避免商业风险。

风险与限制:模型仍处于 beta 阶段,生成质量尤其在复杂场景下的连贯性尚未证实;长视频是否会出现累积误差仍需实测。此外,30% 折扣是初期营销策略,后续定价可能上涨,需评估长期成本。阿里巴巴在 AI 上的巨额投入也带来持续亏损风险,产品迭代节奏存在不确定性。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《阿里巴巴 Wan3.0:从文本、图像和文档生成最长30秒AI视频》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

阿里巴巴 Wan3.0:从文本、图像和文档生成最长30秒AI视频主要讲什么?

阿里巴巴视频生成模型 Wan3.0 进入公测,支持文本、PDF、网页、PPT 输入,可生成最长30秒视频,并同时处理多模态内容。

这篇文章最值得关注的要点是什么?

阿里巴巴视频生成模型 Wan3.0 进入公测,支持文本、PDF、网页、PPT 输入,可生成最长30秒视频,并同时处理多模态内容。;原贴提到:Alibaba's video generation model Wan3.0 is now available in beta. It pro;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI副业、AI工具、AI内容增长专题里阅读。 关联原因:这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容命中「内容」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 MetaRoCE:为 AI 规模以太网打造的全新 RDMA 传输协议 下一篇 NVIDIA Vera Rubin NVL72 树立 AI 智能体效率新标准:每瓦特工作量提升至 30 倍