AI工具可以先按用途分成四类:语言大模型、图片生成、视频生成、AI聚合/工作流平台。
需要先分清三个概念:
小白不用一开始就研究模型参数,先学会”入口在哪里、适合做什么、怎么提问、怎么迭代”就够了。
模型是背后的能力,比如GPTImage 2.0、Seedream(即梦生图)、Veo;
产品入口是你实际打开使用的地方,比如chatGPT、Gemini、豆包、即梦;
聚合平台是把多个模型、素材、画布、工作流放到一起的平台,比如Lovart、TapNow、FlowPix、LibTV。
一、语言大模型:先学会”问问题”和”让AI帮你干活”
各家大语言模型各有各的特点与优势,主要的功能差不多(不过国外的模型都明显强于豆包)。
1.ChatGPT
网页端入口:(chatgpt.com)

适合做什么:
写文案、改文章、总结资料、翻译、做表格、头脑风暴、学习辅导、代码解释、方案策划,同时可做生成式AI创作(生成图片提示词、视频脚本、分镜、内容选题、商业创意方案)
基础用法:
不要只说”帮我写一篇文章”,而是说清楚身份、目标、受众、格式和风格。
2.Gemini
入口:
Gemini官网(gemini.google)

适合做什么:
搜索式问答、资料整理、英文内容处理、图片理解、图像和视频生成入口,同时可做生成式AI创作,例如
提示词生成、视频脚本和分镜设计。
Gemini的会员有个好处,一个会员就可以享受绝大部分谷歌的其他AI平台
例如:
2.1
Flow (https://labs.google/fx/tools/flow/)
Google的AI视频与图片创作平台,开通pro会员后可以接近无限的使用Nano banana模型,以及1个月10条ve03.1视频。

2.2
NotebookLM (https://notebooklm.google/)
NotebookLM是Google的AI笔记和资料研究工具,适合上传文档、生成总结、问答、学习笔记、音频概览和视频概览。
2.3
Google Al Studio
这是偏开发者的平台,可以用来测试Gemini模型、做原型、调用Gemini APlI、体验 Nano Banana Pro和Gemini Pro模型。
3.豆包
入口:https://www.doubao.com/
国民级免费工具(和CHTGPT、gemini相比会差一些,不过免费)

适合做什么:
中文写作、短视频脚本、小红书文案、学习辅导、图片视频生成、PPT/文档任务,也可以做生成式AI创
作,例如批量内容选题、角色设定、故事策划、商业创意方案。
语言大模型使用案例:
1.设计视频分镜
在使用可灵、即梦Seedance、Veo这类视频工具前,可以先让语言大模型帮你拆成多个镜头。
示例:
请把这个视频主题拆成5个分镜:主题是”普通人如何用Al提高工作效率”。每个分镜包括画面描述、镜头运动、字幕和旁白。
2.优化图片和视频提示词
示例:
如果第一次生成的图片或视频效果不好,可以让语言大模型帮你优化提示词。
这张图的问题是画面太乱、标题不突出。请帮我重新优化提示词,让画面更简洁,标题区域更明显,适合做教程封面。
3.批量生成内容选题
示例:
做自媒体、课程、社群内容时,可以让语言大模型批量生成选题。
请帮我生成20个适合AI小白的内容选题,方向包括AI写作、AI绘画、AI视频、AI工具测评,每个标题要适合小红书发布。
4.生成角色设定和故事设定
如果你想做AI短剧、AI动画或系列内容,可以先用语言大模型设定人物、世界观和剧情。
示例:
请帮我设计一个AI科普短视频IP,主角是一位AI小白和一位AI助手。请给出人物设定、内容风格、栏目名称和10期选题。
二、图片类工具
图片工具的核心不是”会不会画画”,而是你能不能把脑子里的画面说清楚。这也就是AI提示词(prompt)
1. Nano Banana 2/Nano Banana Pro
官方工具入口1:(gemini.google)

入2: Flow (https://labs.google/fx/tools/flow)

Nano Banana2主打速度、质量和规模化生成
Nano Banana Pro 则基于Gemini3 Pro Image,更强调推理能力、更加真实,真实世界知识、文字渲染和高精度视觉表达。
适合做什么:改图、插画、人物一致性图片、产品图、文字较清晰的设计图、参考图改图。
优势:
极强的提示词遵循能力,以及图片真实性,适合制作西方人
不足
艺术风格的”惊艳感”可能不如Midjourney。
2. Image 2.0
官方工具入口1:(chatgpt.com)

优点
第一:适合普通人用自然语言控制。
你不用写很复杂的绘画提示词,可以直接说:“帮我做一张AI工具教程封面,标题要醒目,风格要适合小
第二:目前最强的图片文字生成与排版(详情可以看Image2.0玩法)
不足
如果追求极强艺术风格,Midjourney 可能更有优势。
有时候的图片人物会比较的油腻
3. Midjourney官方工具入口:
https://www.midjourney.com/explore?tab=top

优点:
第一,审美强。
Midjourney很适合做”看起来高级”的图,尤其是插画、概念图、电影感、时尚摄影、幻想风格。
第二,风格化能力强。
如果你想要赛博朋克、复古胶片、欧美杂志、电影海报、奇幻世界观,Midjourney往往很容易出效果。
第三,适合做灵感图。
品牌视觉、IP形象、海报方向、场景氛围图,都可以先用Midjourney找感觉。
不足:
对小白来说,上手门槛略高。
中文文字生成和复杂排版不是它的强项。
如果需要严格按照标题、文案、版式生成Image或Nano Banana可能更适合。
4.即梦 Seedream
官方工具入口:https://jimeng.jianying.com/ai-tool/generate?type=image&workspace=undefined

优点
第一,对中文用户友好。
即梦本身就是中文创作者常用入口之一,适合直接用中文描述画面。生成的人物形象比较符合中国人审美
第二,改图能力实用。
它不只是”从零生成图片”,还适合做背景替换、局部修改、人物保持、风格转换、扩图等操作。
不足
极致艺术审美和风格化表现,不如Midjourney。
文字生成的效果也比较一般。
总体来说是“青春版中国特化版nanobanan”
三、视频类工具
目前主力推荐的AI视频生成模型是:可灵3.0、即梦Seedance 2.0,以及刚发布的MiniMax H3。
1.可灵Kling AI
官方入口:https://klingai.com/app/omni/new?ac=1

核心特点
导演级控制:支持多镜头/多场景叙事,可以把一段脚本分成多个镜头一起生成。
强角色一致性:通过Omni参考系统,指定角色/对象的外观并跨镜头保持一致。原生音频同步:生成带有声音、对白、环境音的视频,不需要后期配音。镜头运动控制:可以精细指定镜头运动和摄影效果(例如推进、环绕、拉远等)多模态输入:支持从文字或图像生成,还能读参考图像生成动态过渡。长度弹性:可生成3-15秒视频(或更长片段通过衔接实现)。清晰度爆表(但也贵的爆表):最新支持4k直出,相比于AI超清的,画质无敌。
2.即梦 Seedance
官方入口1:即梦AIhttps://jimeng.jianying.com/ai-tool/generate?type=video&workspace=undefined

官方入口2:小云雀
https://xyq.jianying.com/home?from_page=xiaoyunque_landing_page&tab_name=home
对比与可灵3.0Omni,seedance2.0生成更加合理,且真实。对于提示词的遵循程度也大于可灵。(唯一的缺点就是贵!!)
特点:
2.1.真实世界复杂度生成
物理真实性:严格遵循真实世界运动规律,显著改善人体运动建模的自然度、时序连贯性。
2.2.强大的多模态能力
全面输入:支持文本、图像、视频、音频组合输入(最多3个视频、9张图像、3段音频)导演推理:具备基础的导演和摄影推理能力,可自主规划镜头序列。
2.3.高保真音视频生成
双声道音频:支持沉浸式双声道音频生成多轨输出:同时生成背景音、环境音、角色旁白,与视觉节奏精确对齐。
2.4.生产力场景应用
支持商业广告、影视特效、游戏动画、解说视频等多场景原生支持480p、720p、1080p分辨率,视频时长4-15秒。
3.MiniMax H3
官方入口:海螺 AI: https://hailuoai.com/video/create
开发者API:https://platform.minimaxi.com/docs/api-reference/video-generation-v2-create
MiniMaxH3是MiniMax最新发布的全模态视频生成模型。它不是只靠文字或单张图片生成视频,而是可以同时理解文本、图像、视频和音频之间的关系,再生成带原生声音的视频。

特点:
3.1.全模态参考能力
支持文本、图片、视频、音频一起作为参考输入。
例如,你可以让它参考一个视频的运镜、参考一张图中的人物形象,再参考一段音频中的歌声或氛围,生成新的完整视频。
对于复杂的参考关系、视频编辑、动作迁移会更有优势。
3.2.原生音视频生成
支持原生双声道音频输出。
可同时生成画面、人物声音、环境音和音乐氛围,不需要先出画面、再单独补声音。
3.3.强指令遵循与品牌内容呈现
对于画面里的文字、品牌信息、电商产品展示、UI界面等内容,MiniMaxH3的指令遵循能力更强。
适合做品牌广告、电商短片、动态海报、游戏UI演示、产品宣传片等。
3.4.视频动作迁移与多镜头能力
支持视频到视频的动作迁移:可以参考一个视频中的人物动作、镜头节奏或运镜方式,迁移到新的角色和场景中。
模型原生具备多镜头建模能力,适合需要镜头叙事和更复杂调度的视频。
3.5.最高2K、15秒视频
官方最高支持15秒、2K分辨率的视频输出,且默认提供2K生成。
画质和细节表现很强,尤其适合需要放大观看、展示产品细节或包含品牌文字的画面。
3.6.性价比很高
MiniMax官方给出的定位是:在2K分辨率下,单秒成本低于主流模型的三分之一;768P下的成本约为主流720P模型的一半。
所以如果你既要高分辨率、又需要多模态参考和原生音频,MiniMaxH3很值得重点测试。
注意:H3是刚发布的新模型,复杂场景下的极细小画面细节仍有提升空间。实际可用的功能、价格和入口以海螺AI当前页面为准。
四、AI聚合类/工作流平台
这一类工具不是单纯生成一张图或一段视频,而是把模型、画布、素材、脚本、分镜、批量生成、编辑流程整合在一起。适合做品牌视觉、广告片、社媒内容矩阵、课程素材包。
优势说明
一次上传,多平台复用:不需要每个工具都开会员,也不用反复上传同一素材。聚合平台可以在一个工作流里调动不同AI模型生成图片、视频、文本。
工作流复用:可以直接使用社区模板或已有流程,快速生成内容,再替换文字、图片或产品素材。
适合完整项目:品牌宣传、社媒系列内容、课程素材包等,可以在一个平台完成从构思到成品的全过程。
1.FlowPix
入口:FlowPix官网。(flowpix.club)
适合做什么:工作流复用、品牌内容、社媒图片、电商视觉、海报、AI图片/视频工作流学习

2.Lovart
入口:Lovart官网。(lovart.ai)
适合做什么:设计类、品牌设计、Logo、包装、社媒物料、营销活动

3.LibTV
入口:LibTV官网。(liblib.tv)
适合做什么:视频创作流程、脚本到成片、专业视频协作

4.TapNow(与Libtv类似,都是专注于制作影片)
入口:TapNow官网/App。(tapnow.com)
适合做什么:视觉工作流、短片创作、分镜、品牌视觉
操作步骤与逻辑与Libtv一致
总结
对AI小白来说,最重要的不是一口气学会所有工具,而是先建立一个简单认知:
语言大模型负责思考和写作,图片模型负责视觉设计,视频模型负责动态表达,
聚合平台可以直接将以上所有平台聚集在一处执行。
入门路线可以很简单:
先用ChatGPT/Gemini/豆包写出想法,再用Nano Banana/GPT Image/即梦/Midjourney生成图片,接着用可灵/Seedance/Veo做成短视频。或者直接用FlowPix/LibTV/Lovart/TapNow 直接制作完整的作品。