我本来想等到使用oiioii做完第一个完整故事再来评论的,但是我低估了创作的复杂度,sora2审核的复杂度,也高估了工作流的智能程度,所以短片至今未能做完。
我是个稍微懂点技术又比较挑剔的人,但是使用这个agent的确是让我惊艳到了,作为一个“全球首个”产品,它能有这么高的完成度是我没想到的。尽管有一些还可以优化的点,整理而言我觉得整个agent的设计和结构已经相当好了。
我的习惯是先讲优点。
使用选择代替文本(图1),减少认知负担。less is more的哲学在这里可以得到一点体现。很多agent是默认要用户的高认知负荷地参与的,比如某些deep research工具向你确认研究方案时抛出来的抽象问题。 从第一个点开始降低使用门槛,非常好。
通过群聊式的多agent共享session,而非主agent调度各种工具,来实现功能的分化和上下文的管理和统一,通过用户选项来固定全局变量。虽然这是很早就被宣传和设计出来的架构,但这一点在当前主流的agent中落地的并不多(或许架构已经定好的历史包袱很重),我觉得这是某种后发优势。
已经具备比较好的工作流设计。从角色定位上有艺术总监(主agent),编剧,分镜师、角色设计师,短片风格助理等 角色,各自专精一个活,来从功能上cover住理论上的整个短片创建的工作流,不会太多,也不会太少。
通过画布的xyflow的形式来串起用户对于短片创作的视觉感知,左侧的对话框自动托管,右侧的canvas低代码,我再一次为这个less is more的设计感叹。国内互联网不知道多少产品经理把产品做得像屎一样折磨用户,只会做加法不会做减法。感觉这产品设计真是有水平。(图2)
调用sora2/midjounery/nano banana之类的相对比较前沿而且普通用户在正常的环境下不可能调用得到的模型,并且利用它们各自的优势,还要研究怎么修改提示词。不仅要对前沿有了解,还要熟悉风格,还要研究prompt engineering,这是不小的工作量的。(图2)
它甚至还可以多个工作空间同时跑多个任务
当然优点说完了(其实还没说完,因为最近比较忙没探索太多),这篇评价还是有点不够全面。
我需要谈一些使用过程中的槽点,或者待改进项。
首先全局变量的选择:对白语言这个选项有时候不弹,导致生成了七八个分镜的时候发现是中文的。(见图1)。如果我可以知道有哪些全局变量我能提前设置好的话,会降低试错或者后悔的概率。
从我长期使用纯文本LLM的直觉来看,我觉得作为整个session维护者的文本模型表现得不是很好,比如会出现大量的重复内容(见图3,整个session中“下一步你只需要总结而不需要再次输出代码块”出现了66次;或者图4,agent自己批评自己然后给我道歉),看起来可能是提示词的问题或者是过高的复杂性难以处理。考虑到视频模型的成本非常大,我建议在文本模型上上一点预算,选择好一些的文本模型,这样性价比会更高,比如文本创作选择 kimi-k2-thinking或者即将发布的gemini3 或者deepseek-v3.2;指令生成用glm4.6或qwen3-480b-coder 都行。然后在prompt设计的时候,用各类sota模型让它们评估一下系统指令有没有歧义。
托管模式下角色设计完没有review就开始生成视频了(图5 ,jerry画得和morty一样)。我觉得这是一个不好的点,错误应该在尽早发现,而不是等到视频都生成完了才意识到出了问题。我的建议是,反正用户是做选择,那就让他多做几个,确认一下也还可以。当然,可以用多模态模型来review一下。
时间分片的连续性问题,编剧和主agent对分镜数量和视频时间估计的相当不精准。我注意到短片模式下,基本上都是7-10个分镜,实际上sora最长也就15s一个(虽然支持30s但是在这里没有看到过,甚至很多都只是8s)用户或者创作者很容易不知道他们想要的那个短片具体要多久,一旦给了过长或过短的故事,要么过于零散,要么过于稠密,导致最终的结果就是我看到了好些个零散片段,但是实际上无法拼凑成一个故事。换句话说,这对用户提出了很高的要求:我要知道怎么创作那个恰到好处长度的故事又恰到好处地可以衔接起来。我的建议是先估计一下用户想讲的这个故事大概是要多久,需要多少个镜头。
故事连续性问题,编剧非常简单地把故事粗暴地拆分成了等长的剧情,但是完全忽略了特写、效果等因素,意味着这些都需要用户自己后期慢慢去磨和调整。自动最终变成了手动。我的建议是优化prompt,或者提前评估故事的复杂性和合理性。
视频产出风格的稳定性问题:图7, 镜头4 产生了竖屏。图8, 各个分镜差异迥异(色调、画风、方向之类的)。我的建议是先生成一张或几张不同时间点的基准图,作为全局风格来对齐。
最后,我注意到让它自己评估视频的时候,它只能通过图片多模态来看,而不是视频多模态(而且评估结果也有点好笑,说注意到有的视频音频不完整)。我记得qwen也有一些开源的视频多模态模型,完全可以拿来评估一下剧情是否被实现。视频生成质量和内容是否符合预期,来让整个流程更加完整。
整体就是这些吧,我觉得我的这个评价也对得起开销这么大的工具给我免费体验了,当然,这个工具也值得我用心去评价。