文本、图像、视频、音频、基础能力五大类。每个模型是干什么的、多少钱,一篇文章对齐
百炼是什么,怎么接入,怎么计费。
阿里云百炼(Model Studio)是阿里云的大模型服务平台,聚合通义千问(Qwen)系列与第三方模型共150余款,覆盖文本生成、图像生成与编辑、视频生成与编辑、音频语音及基础能力五大类。
接入方式有四种:OpenAI兼容API(改API Key、base_url、模型名即可迁移现有代码)、SDK、命令行工具与控制台可视化界面。部署地域包括北京、新加坡、法兰克福、东京、香港。计费支持按量付费与Token Plan订阅两种;新用户开通后每个模型各获100万Token免费额度(90天内有效)。
文中价格均为中国内地按量付费原价,不含限时优惠;Batch调用、上下文缓存与订阅套餐另有折扣,以官方计费页为准。
千问系列、第三方模型与领域模型。价格为输入/输出,元/百万Token。
千问系列在售主力为3.8与3.7两代:稀疏MoE架构,100万Token上下文,支持深度思考、Function Calling、结构化输出、联网搜索与上下文缓存,多数模型原生接受文本、图像、视频输入。
| 模型 | 定位 | 输入 | 价格(输入/输出) | 典型用途 |
|---|---|---|---|---|
| qwen3.8-max | 旗舰 | 文本/图像/视频 | 12 / 36 元 | 复杂推理、全栈代码工程、长周期智能体任务 |
| qwen3.8-flash | 轻量多模态 | 文本/图像/视频 | 0.8 / 2.7 元 | 高并发日常任务、代码辅助、成本敏感场景 |
| qwen3.8-27B | 开源版 | 文本/图像/视频 | 开源自部署 | 自行部署与二次开发 |
| qwen3.7-max | 纯文本旗舰 | 文本 | 12 / 36 元 | 纯文本深度推理、长逻辑推演 |
| qwen3.7-plus | 多模态智能体 | 文本/图像/视频 | 1.6 / 6.4 元 | GUI界面操作、智能体工作流、视觉问答 |
| qwen3.7-flash | 高速轻量 | 文本/图像/视频 | 0.2 / 0.8 元 | 实时对话、高并发轻量任务 |
第三方模型:DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi-K3、GLM-5.2、GLM-5.3、MiniMax-M3、MiMo等,调用格式与千问一致,切换只需改模型名。
领域模型:代码、数学、翻译、法律、数据挖掘、Deep Research、意图理解、角色扮演、对话分析等垂类模型。
千问图像、万相、Z-Image三个系列。价格为生成费用,元/张。
图像模型分三个系列:千问图像(Qwen-Image)主打复杂版面与文字渲染,万相(Wan)主打高分辨率与多图参考,Z-Image主打快速生成。除Z-Image仅支持文生图外,其余同时支持文生图与图像编辑;编辑时每张输入图片另计0.02元。
| 模型 | 能力 | 最大分辨率 | 价格 | 功能特点与适用场景 |
|---|---|---|---|---|
| qwen-image-3.0-pro | 文生图 + 编辑 | 2048×2048 | 1K 0.25 / 2K 0.5 元 | 4.5k Token长指令、10px小字渲染、12国语言、图中图密集排版;海报、分镜、试卷、UI界面 |
| qwen-image-3.0 | 文生图 + 编辑 | 2048×2048 | 0.18 元 | 标准版,生成速度更快 |
| wan2.7-image-pro | 文生图 + 编辑 | 4096×4096 | 0.5 元 | 品牌色控制、最多9张参考图、角色一致性、边界框交互式编辑 |
| wan2.7-image | 文生图 + 编辑 | 2048×2048 | 0.2 元 | 速度版,支持连续生成4张(最多12张) |
| z-image-turbo | 文生图 | 2048×2048 | 0.1 元起 | 6B参数轻量模型,速度快,适合写实人像与产品图;思考模式0.2元 |
万相与欢乐马两个系列。价格为元/秒。
视频模型分两个系列:万相3.0采用"全能参考"设计,参考素材可以是图片、音频、视频,也可以是docx、ppt、pdf文件和网页链接;欢乐马(HappyHorse)1.1生成原生带音频的视频。另有编辑与动作迁移专项模型。
| 模型 | 类型 | 规格 | 价格 | 功能特点 |
|---|---|---|---|---|
| wan3.0-video | 全能参考 | 480P–1080P,2–30秒 | 0.3 / 0.6 / 1.2 元/秒 | 文生视频、首帧/首尾帧、参考生视频;价格按480P/720P/1080P分档,失败不计费 |
| wan3.0-video-prime | 全能参考(优速) | 480P–1080P,2–30秒 | 以官网为准 | 能力同上,生成速度更快 |
| happyhorse-1.1 系列 | 文生/首帧/参考生视频 | 480P–1080P,3–15秒 | 720P 0.9 / 1080P 1.2 元/秒 | 原生音频一次成片;r2v支持9张角色参考图保持一致性 |
| happyhorse-1.0-video-edit | 视频编辑 | 720P/1080P,3–15秒 | 以官网为准 | 按文本指令做风格转换、元素替换 |
| wan2.7-videoedit | 视频编辑 | 720P/1080P,2–10秒 | 以官网为准 | 特效复刻、运镜复刻 |
| wan2.2-animate-move | 动作迁移 | 720P,2–30秒 | 以官网为准 | 把参考视频动作迁移到静态图片人物上 |
| wan2.2-animate-mix | 人物替换 | 720P,2–30秒 | 以官网为准 | 把视频中人物替换为图片人物 |
合成、识别、翻译、端到端对话、音乐五类。
不直接对话,是构建应用时的配套层。
我要做X,用哪个模型。
| 需求场景 | 对应模型 |
|---|---|
| 复杂代码工程、长周期智能体任务 | qwen3.8-max |
| 高并发客服、日常问答、成本敏感 | qwen3.8-flash / qwen3.7-flash |
| 纯文本深度推理 | qwen3.7-max |
| GUI操作、智能体工作流 | qwen3.7-plus |
| 海报、分镜等含文字的复杂版面 | qwen-image-3.0-pro |
| 品牌视觉、高分辨率、多图参考 | wan2.7-image-pro |
| 批量快速出图 | z-image-turbo |
| 生成带声音的短视频 | happyhorse-1.1 系列 |
| 长视频、以文档或网页为素材 | wan3.0-video |
| 有声读物、语音播报 | TTS 系列(qwen-audio-3.0-tts-plus 等) |
| 实时语音助手 | qwen3.5-omni-plus-realtime |
| 知识库问答(RAG) | text-embedding-v4 + qwen3-rerank |
| 生成3D资产 | Tripo 系列 |
以上为截至2026年9月的模型分类与价格情况。百炼控制台的模型广场按能力维度列出全部在售模型,每个模型详情页附带说明文档与在线体验入口;模型清单持续更新,最新状态以官方帮助文档为准。