AI 辅助创作与 MAID
资料状态
本页依据截至 2026-07-25 可核验的产品文档、平台规则、社区教程与创作案例整理。AI 产品名称、模型版本和服务状态变化很快,工具清单只代表核验时可用的入口,不构成长期排名。
本站讨论范围
MAD DOC 主要讨论以 Bilibili 为发布、赛事和交流中心的 MAD·AMV 圈层。在这一语境中,筛选素材、提取音频、抠图初稿、生成表达式等轻量辅助通常比生成主要画面或角色声音更容易被接受;以 AI 大幅替代选材、绘制、声音和镜头制作的作品,目前并不代表该圈层普遍认可的 MAD·AMV 创作方式。
AI 已经进入 MAD·AMV 的策划、素材处理、画面生成、声音制作和交付检查,但不同用途在圈内的接受程度相差很大。“使用了 AI”不能单独说明作品的创作方式,是否可以参赛也不能凭日常创作习惯推断。
名称与边界
| 记录方式 | 典型情况 | Bilibili MAD·AMV 圈层中的一般理解 |
|---|---|---|
| 轻量 AI 辅助 | 筛选素材、整理检索词、生成表达式、检查工程;最终音画不直接包含生成内容 | 通常作为效率工具看待,但比赛可能完全禁止 |
| 素材处理辅助 | 提取对白/伴奏、抠图或遮罩初稿、少量修补、转写、降噪 | 是否属于“轻量”取决于处理范围、结果是否进入成片及活动规则 |
| AI 生成素材 | 生成背景、角色图、主要镜头、音效、音乐、对白或歌声并进入成片 | 接受度明显较低,应与传统 MAD·AMV 分开说明 |
| MAID | 以 AI 生成素材为主要素材来源,再通过剪辑、合成和视听组织形成作品 | 社区提出的探索性称呼,不代表传统圈层或比赛普遍接纳 |
“MAID”由 Bilibili MAD 创作者醉石散客提出,MAD Producer 的妹抖研究所将其解释为“使用 AI 生成素材进行创作的 MAD”。本页保留该称呼是为了记录中文社区的技术探索,不表示 MAD DOC 将 MAID 视为当前 Bilibili MAD·AMV 的主流类别,也不表示圈内或比赛已经普遍接受。
圈内通常怎样区分
较容易被接受的轻量辅助
这类工具主要减少重复劳动,作品的主题、选材、镜头组织、节奏和最终判断仍由作者完成:
- 根据作者给出的条件筛选素材表、整理集数和检索词;
- 使用声源分离提取对白、人声或伴奏,随后人工清理;
- 为漫画、立绘或动画人物生成抠图和遮罩初稿,再人工修边;
- 生成 After Effects 表达式、脚本或批处理命令;
- 转写对白、检查字幕、核对缺失文件和导出项目;
- 对少量缺损边缘、背景空洞或压缩噪点进行辅助修补。
这里的“容易被接受”描述的是一般创作交流,不是赛事许可。AI 工具即使只做抠图或表达式,也可能被某届比赛的全面禁用条款覆盖。
争议较大的生成式替代
以下情况会直接改变最终作品的主要音画,通常不被当前 Bilibili 长篇 MAD·AMV 圈层视为普通的轻量辅助:
- 大量生成角色、背景或连续镜头,替代原作选镜和人工画面制作;
- 使用生成视频完成主要段落,只在后期进行拼接;
- 克隆动漫角色或声优音色,生成新的对白或歌声;
- 生成完整配乐、演唱或关键音效并作为作品主体;
- 用一键式模板自动完成主要剪辑、节奏和视觉设计。
这类作品可以作为 AI 影像、生成式二创或 MAID 个案研究,但不应借用“辅助工具”的说法弱化实际生成范围。介绍作品时应明确哪些画面和声音由模型生成。
比赛规则可能比圈内惯例更严格
不同赛事对 AI 的规则已经出现明显差异:
- IMAC FUN#4明确写明禁止使用 AI 或 AI 辅助创作,轻量用途也不能据此豁免;
- 蔷薇宴 2026明确排除纯 AIGC 动画,但这不等于其他 AI 用途自动获准;
- MAD Producer《MAD 比赛标准规则》是通俗通用框架,具体比赛仍可增加、删除或修改条款。
准备参赛时,应把“具体工具 + 具体功能 + 使用镜头或环节”发给主办方确认,不能只问一句“可不可以使用 AI”。详见比赛与投稿规范。
2024 年资料为何需要更新
妹抖研究所及其早期专栏形成于 2024 年前后,当时主要以 Stable Diffusion、ComfyUI、FLUX Fill、RVC、VITS 和 DiffSinger 解释 AI 影像与声音。它们仍能说明中文 MAD 创作者最早如何把生成模型用于补图、扩图、抠图和声乐,但不再足以概括当前工作流:
- 图像生成与局部编辑已经合并到 ChatGPT Images、豆包/Seedream、Firefly 等通用产品中;
- 视频模型开始同时接受文字、图片、音频和参考视频,可生成、延长或定向修改短镜头;
- ComfyUI 已由单一图像节点界面发展为可编排图像、视频、音频和模型的工作流环境;
- 角色声音需要区分文字转语音、语音转换和歌声合成,不能继续统称“AI 声乐”;
- 中国大陆已实施生成合成内容标识制度,Bilibili 也要求发布者主动选择 AI 标识;
- 旧页面提到的 Sora 网页端和应用已于 2026-04-26 停止服务,不能继续列为当前使用入口。
因此,旧专栏在 MAD DOC 中作为技术史快照保留。本页后续章节用于解释这些技术实际上能做什么及其风险,不构成对大幅生成式创作的推荐。
当前创作环节
1. 策划、检索与工程辅助
ChatGPT、豆包等通用对话模型可以在轻量范围内协助:
- 把作者已有的主题拆成情绪曲线、音乐段落和镜头需求;
- 生成素材检索词、同义词、外语译名和镜头记录表初稿;
- 整理字幕、翻译草稿、表达式、批处理命令和交付检查清单;
- 对作者提供的工程说明做缺项检查。
更贴近圈内实际的用法,是让模型处理作者已经定义好的小任务,例如生成表达式初稿、整理素材关键词或检查交付清单,而不是让模型决定主题、代选全部镜头或生成完整剪辑。
这类模型不能替代史料检索、作品判断或最终文案。模型给出的作者、比赛、首发日期和引文必须回到原页面核验;未公开工程、比赛稿件和受保密协议约束的素材也不应上传到条款不明的服务。
2. 图像生成、修补与分层
| 任务 | 当前可用路径 | 在 MAD·AMV 中的用途 | 必查问题 |
|---|---|---|---|
| 文生图/参考生图 | ChatGPT Images、豆包/Seedream、Adobe Firefly、ComfyUI 工作流 | 概念图、背景、图形元素、原创插入画面 | 人物身份、服装和画风能否跨镜头保持 |
| 局部编辑/扩图 | ChatGPT Images、Seedream、Firefly Generative Fill、ComfyUI inpaint | 补齐画幅、清理穿帮、修复漫画格、延展背景 | 编辑是否越过选区,是否改坏原作线条 |
| 静态抠图 | BiRefNet、SAM 2、软件内置选择工具 | 漫画人物分层、背景替换、前后景拆分 | 发丝、半透明、运动模糊和描边 |
| 视频分割/跟踪 | SAM 2、AE/Resolve 等宿主工具 | 人物遮罩、局部调色、景深和合成 | 遮挡、快速动作、镜头切换处是否漂移 |
| 超分与修复 | 宿主智能功能、专用修复模型 | 旧素材预览、局部修补和放大测试 | 不把生成纹理误当作原始细节 |
ChatGPT Images支持上传既有图像后增加、删除、修改局部或输出透明背景;Seedream 4.0—5.0 文档记录了文生图、参考图、组图和图像编辑;ComfyUI则适合把模型、遮罩、修补、放大和输出参数保存为可复查的节点图。
自动抠图只应作为遮罩初稿。MAD 中常见的动漫描边、速度线、发光、半透明头发和强压缩素材容易产生边缘缺口,最终仍需在实际播放背景上逐帧检查。
3. 视频生成、转绘与镜头延长
当前视频生成不再只有“文字生成一段随机视频”。常见输入方式包括:
- 文生视频:用于视觉提案、空镜或无法拍摄的原创画面;
- 图生视频:把角色设定图、背景或首尾帧转为短镜头;
- 参考视频生视频:参考运镜、动作、构图或节奏进行转绘和替换;
- 视频编辑/延长:修改指定对象、场景或动作,或为原镜头生成后续段落;
- 音画联合生成:根据音乐、对白或音效生成带同步关系的镜头。
火山引擎在 2026 年发布的 Seedance 2.0 说明中列出文字、图片、音频、视频四类输入,并给出 MV、参考运镜、视频编辑和镜头延长示例。Adobe Firefly 的当前文档也把文生视频、图生视频、参考运镜、透明背景视频、视频编辑和放大列为不同能力入口。
在 MAD·AMV 中,更稳定的做法是先把生成模型当作短镜头生产环节:
- 先在剪辑软件中确定镜头时长、起止构图和运动方向;
- 生成多个短段落,而不是要求模型一次完成整支作品;
- 对人物比例、手部、口型、背景连续性和镜头轴线逐帧检查;
- 用人工剪辑、遮罩、调色、速度曲线和声音设计统一生成片段;
- 保留未生成的原始参考图、提示词、模型版本和每次输出。
Bilibili 上的 2023 年 AI 动画补帧/转绘案例已经展示了“抠图分层—慢放补帧—逐帧 AI 重绘—重新合成”的流程;2026 年的《如何用 AI 在三天内做出“异环”二创》则反映了平台内 AI 动画二创与创作工具入口的进一步结合。这些案例只能证明工作流正在被采用,不能单独证明其版权状态或适用于所有 MAD 比赛。
4. 对白、角色声音与歌声
“让动漫角色说话或唱歌”至少包含四种不同技术:
| 类型 | 输入与输出 | 代表性路径 | 适用情况 |
|---|---|---|---|
| TTS/少样本声音克隆 | 输入文字和参考声音,输出目标音色的语音 | GPT-SoVITS 等 | 新对白、旁白、角色口播 |
| Voice Conversion/VC | 输入作者实际录制的语音,转换音色并保留表演节奏 | RVC、SVC 等 | 需要自行控制语气、停顿和情绪的对白 |
| Singing Voice Conversion | 输入演唱轨,转换歌声音色 | RVC、SVC 类工作流 | AI 翻唱、角色歌实验 |
| 歌声合成 | 输入歌词、音符、音高和参数,直接合成歌声 | DiffSinger 等 | 有明确旋律、歌词和调声需求的作品 |
GPT-SoVITS是文字转语音与少样本声音克隆项目;RVC是语音转换框架。两者不能因为名称都含有 SoVITS 就视为同一种流程。
Bilibili 已有大量动漫与游戏角色的 GPT-SoVITS、RVC 和歌声转换示例。这类内容说明角色音色模型已经进入二创工作流,同时也具有最高的误导与权利风险:
- 训练或参考音频中的自然人声音应取得明确许可,不能把“网上可以听到”理解为可以训练和发布;
- 录音制品、角色台词、声优表演、角色形象和作品名称可能分别涉及不同权利;
- 不得把合成对白伪装成官方剧情、声优本人发言或原作未公开录音;
- 说明中应写明“AI 合成/声音转换”、声音来源、授权范围和人工表演者;
- 不应公开传播无权分发的角色音色模型或原始语音数据集。
最高人民法院发布的典型案例明确:AI 合成声音能够使公众关联到特定自然人时,其声音权益可以延伸到该 AI 声音;未经许可 AI 化使用他人声音可能构成人格权侵权。Bilibili 2026 年平台公告也把“AI 虚假配音”列为从严处置对象。
5. 音源分离、配乐与音效
- 声源分离:Demucs、UVR 等可以从混合音轨估计人声、鼓、贝斯和其他部分,也可辅助提取对白或降低原背景音乐。输出是模型估计结果,不等于获得官方分轨。
- 语音转写与翻译:Whisper、宿主转写和多语言配音工具可生成字幕或翻译初稿;角色名、作品名和歌词必须人工校对。
- 生成音乐与音效:可用于草稿节奏、原创插入段落、环境声和转场音效;发布前应确认服务条款、商业使用范围、训练素材争议和音乐平台要求。
- 翻译配音与对口型:Adobe Firefly 等服务可以转写、翻译和生成配音;输出仍需核对译文、说话人、音色许可和口型错误。
2019 年的 AMV 消除对白/背景音乐教程后来由作者加注“方法已过时”,并指出基于 Spleeter 一类模型的分离工具已超过旧式相位抵消流程。这一变化说明 AI 对 MAD 的影响不只在“生成新素材”,也在替换旧的素材预处理方法。
6. 补帧、放大与自动检查
AI 补帧、重定时、降噪、去色带和超分辨率可以改善特定素材,但不应直接套用到整片:
- 动漫有限动画中的重复帧可能被错误理解为缺帧;
- 快速运动、遮挡、粒子、闪白和复杂线条容易产生果冻、重影或凭空细节;
- 放大模型可能改变角色五官、文字、网点和原作线条;
- 自动镜头识别、人物检索和重复片段检测适合整理素材,不应代替选镜判断。
测试时应保留原片段,使用相同缩放和码率做 A/B 对比,并在 100% 画面、逐帧和正常播放三种状态下检查。
一套可复查的 AI 工作流
- 确定用途:先写清 AI 是辅助策划、处理既有素材,还是生成最终音画。
- 建立权利清单:记录动画、漫画、音乐、声音、参考图和模型数据的来源与许可。
- 先剪后生成:用占位镜头确定时长、节奏、构图和镜头方向。
- 小段生成:按镜头生成图像、视频或声音,避免一次性生成整片后被动拼接。
- 人工合成:在剪辑/合成软件中修正遮罩、运动、颜色、口型、声音和连续性。
- 记录过程:保存工具、模型版本、提示词、参考素材、种子/工作流和生成日期。
- 逐项质检:检查人物一致性、画面伪影、音频底噪、错误台词、权利和赛事限制。
- 主动标识:按发布地法规、平台功能和活动规则完成显式说明与 AI 标签。
发布说明怎么写
作品说明应让观众和赛事组织者判断 AI 实际参与了什么,而不是只写“含 AI”:
本作在 00:42—00:49 使用生成式视频制作背景延长;角色主体来自作者自绘设定图。01:10 的对白使用经授权的参考声音进行 TTS 合成。其余动画素材、音乐与人工剪辑信息见素材表。使用工具与版本:……。生成片段均经过人工遮罩、调色和合成。发布时已启用平台 AI 生成合成内容标识。
最少应包含:
- 生成或处理的具体镜头、画面区域、对白或音乐段落;
- 工具、模型与大致版本;
- 参考素材、声音和训练数据的来源与授权情况;
- 人工绘制、表演、剪辑、合成和修改的范围;
- 是否保留工具附带的水印、Content Credentials 或其他来源信息;
- 平台 AI 标签和比赛申报状态。
中国大陆发布与权利边界
《人工智能生成合成内容标识办法》自 2025-09-01 起施行,覆盖利用 AI 生成、合成的文字、图片、音频、视频和虚拟场景,区分用户可感知的显式标识与文件元数据中的隐式标识。发布者应主动声明生成合成内容,不得恶意删除、篡改、伪造或隐匿规定标识。
Bilibili 在 2026-05-15 的专项公告中说明,涉及 AI 生成合成内容均需标识,投稿端已把 AI 标识提升到一级页面;漏标内容可能被补标、打回或下架,AI 虚假配音、换脸误导和虚假新闻会被从严处理。
上述要求解决的是标识与传播责任,不等同于已经取得原动画、音乐、角色形象、声优声音或训练素材的使用许可。公开作品还需同时遵守著作权、人格权、平台公约和比赛规则。
资料与入口
MAD Producer 旧专栏
当前官方技术资料
- ChatGPT Images
- Seedream 4.0—5.0 提示词与图像编辑
- Seedance 2.0 多模态视频生成
- ComfyUI 工作流
- Adobe Firefly 音视频功能
- SAM 2 图像与视频分割
- BiRefNet 高分辨率图像分割
- GPT-SoVITS
- RVC WebUI
- Demucs 声源分离
