8848AI 模型指南
按系列精简介绍
模型能力总览

选择适合你的 AI 模型

本页按模型系列介绍核心能力,不再逐个细分版本。8848AI 覆盖文本与代码、图片生成、视频生成、语音合成和语音识别,可用于内容生产、商业设计、智能客服、会议转写及软件开发。

本次新增14款模型:覆盖视频生成、图片生成、语音合成、语音识别和大语言模型五大能力。具体模型价格、计费规则及可用状态,请以 8848AI 模型广场实时展示为准。

Claude 系列

文本、推理与编程

Claude Opus

旗舰级复杂任务模型,适合深度推理、系统架构、研究分析和高质量专业交付。

复杂分析架构与编程重要方案与长文

Claude Sonnet

兼顾质量、速度和成本的主力系列,适合日常办公、内容生产、代码开发和自动化工作流。

日常生产力代码开发内容与客服

Claude Haiku

强调低延迟和经济性的轻量系列,适合摘要、分类、信息抽取和高并发基础任务。

快速问答批量处理轻量自动化

Claude Fable

偏向创意表达与高质量内容生产,适合故事、品牌文案和风格化写作。

创意写作品牌文案内容润色

GPT-5.6 系列

通用智能与软件开发

GPT-5.6 Sol

综合能力强,适合复杂推理、软件开发、工具调用和高质量通用任务。

复杂任务编程开发智能体工作流

GPT-5.6 Terra

在能力、速度和成本之间保持平衡,适合日常业务、内容处理和稳定生产调用。

日常业务内容处理批量调用

GPT-5.6 Luna

更注重响应速度和使用效率,适合轻量问答、快速生成和高频交互。

快速响应轻量问答高频交互

图片生成系列

图片生成与编辑

GPT Image

擅长提示词理解、画面构成和实用型视觉内容生成。

海报配图产品概念图内容素材

Qwen-Image 3.0

兼顾生成效果与效率的通用图片模型,支持1K、2K规格,适合大多数日常视觉创作。

日常配图社交素材商品与场景图

Qwen-Image 3.0 Pro

强化复杂提示词理解、画面细节、构图和高清输出,支持1K、2K规格,适合专业视觉设计。

商业设计高清展示复杂构图

HappyHorse 1.1 视频模型(3款)

3–15秒|480P/720P/1080P|原生音画同步

文生视频(T2V)

根据文字描述生成包含画面、主体、动作、镜头和原生音轨的完整视频。

广告宣传片产品介绍创意与剧情短视频

图生视频(I2V)

支持单张图片生成,也支持首帧与尾帧图片共同生成;输入动作或镜头描述,即可让静态画面自然动起来或控制视频起止画面。

商品动态展示角色动画首尾帧过渡

参考生视频(R2V)

依据多张参考素材中的主体、风格或视觉特征生成新视频,保持角色和品牌视觉一致。

IP连续创作品牌视觉统一系列内容制作

关键调用参数

模型名称happyhorse-1.1-t2vhappyhorse-1.1-i2vhappyhorse-1.1-r2v
duration(时长)整数 3–15 秒;未传时默认 5 秒。
resolution(清晰度)480P / 720P / 1080P;建议显式传入,未传默认 720P。
ratio(画面比例)T2V、R2V 支持 16:99:163:44:34:55:41:19:2121:9。I2V 自动跟随首帧图片比例,不要传 ratio。
prompt(提示词)必填;含中文时不超过 2500 字符,纯非中文内容不超过 5000 字符。
素材要求T2V 不传图片;I2V 支持传 1 张图片,或同时传首帧和尾帧图片;R2V 必须传 1–9 张参考图片。支持 JPEG、PNG、WEBP 的公网 URL 或合规 Base64 Data URI。
横竖屏:横屏常用 16:9,竖屏常用 9:16。I2V 的横竖比例由上传图片决定,使用首尾帧时两张图片应保持相同比例。

Wan 3.0 视频模型(2款)

最长30秒|480P/720P/1080P|原生音画同步

Wan 3.0 Standard

支持文生视频、单张图片生成及首尾帧图片生成,适合日常创作、批量生产及对完成时间要求不高的任务。

广告与产品展示首尾帧过渡连续动作与长镜头

Wan 3.0 Prime

画质、功能和参数与标准版一致,生成速度约为标准版的5倍,适合紧急项目和高效率生产。

紧急项目高效内容生产商业交付

关键调用参数

模型名称wan3.0-videowan3.0-video-prime
duration(时长)整数 2–30 秒;未传时默认 5 秒;-1 表示智能时长。
resolution(清晰度)必须明确指定 480P720P1080P,推荐使用结构化 resolution 字段。
ratio(画面比例)adaptive16:94:31:13:49:16;未传默认 adaptive
prompt / media文字与素材不能同时为空。文生视频传 prompt;图生视频可传单张图片,也可同时传首帧 first_frame 与尾帧 last_frame,用于控制视频起止画面。
音频与帧率原生音频默认开启;帧率固定 30 FPS,不要传 fps 参数。
横竖屏:16:9 为横屏,9:16 为竖屏,1:1 为方形。若同时传 width/height,必须与 ratio 一致;推荐只传 ratio,避免参数冲突。
Standard 与 Prime:调用参数、功能和画质规格一致;Prime 仅提升生成速度,约为 Standard 的 5 倍。

Qwen Audio 3.0 语音模型(5款)

语音合成、文件转写与实时识别

TTS Flash

高速文字转语音,支持中文、英文及中英文混合文本,适合高频和批量生成。

短视频旁白客服播报批量语音

TTS Plus

更注重自然度、音质和表达效果,适合对成品质量要求较高的配音。

品牌配音有声内容AI主播与课程

ASR Flash

短音频同步识别,可返回普通文本、结构化结果及带时间信息的详细结果。

语音输入短录音转写字幕提取

ASR Flash Filetrans

长音频异步转写,支持词级时间信息和置信度,无需持续连接等待。

会议与采访课程与播客批量长音频

ASR Flash Streaming

低延迟实时流式识别,可在讲话过程中持续返回文字结果。

实时字幕语音助手直播与会议记录

Qwen 3.8 大语言模型(2款)

文本、推理、代码与数据分析

Qwen 3.8 27B

兼顾响应效率和综合能力,适合日常业务调用、内容处理和批量任务。

业务问答内容生产代码辅助

Qwen 3.8 Max

旗舰级模型,强化复杂指令理解、逻辑推理、长文本处理和高质量生成。

复杂推理长文档处理高质量专业交付

多模态 AI 创作流程

  1. 使用推理和文字模型完成创意策划、脚本编写与提示词优化;
  2. 使用图片模型生成角色、商品图、封面和场景素材;
  3. 使用视频模型将文字、图片或参考素材转化为视频;
  4. 使用 TTS 制作旁白、客服语音和品牌配音;
  5. 使用 ASR 识别音频并生成字幕、会议记录或文字稿。

通过文字、图片、语音和视频模型协同,8848AI 可覆盖从策划、素材生成到内容交付的完整多模态生产流程。