- capability 枚举加 m2t(多媒体生文)——会话agent可选模型范围 t2t/i2t/m2t 的字典侧 - 判定表补「仅图像(+文本)→文本 ⇒ i2t」「多种媒体输入→文本 ⇒ m2t」「仅文本→文本 ⇒ t2t」, 堵住此前只有视频/图像输出侧判定、文本输出侧全靠 LLM 猜的缺口(wan3.0 误判同类根因) - r2v 判定加「且输出为视频」限定:原文「多种媒体输入⇒r2v」会把多媒体理解模型 (如 qwen-vl 类 i2t/m2t)误吸进 r2v——输出模态必须同时满足 - _MEDIA_INPUT_CAPS 加 m2t:模板生成把 m2t 按输入媒体能力处理(URL 叶子判上传媒体)