arXiv · 多模态、视频与世界模型· Mikhail Dereviannykh·· 3 天前精选AI 评分76
SemanTok:面向高效自回归视频生成的可预测语义 token
SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation
AI 导读
论文提出 SemanTok,一种将冻结的 DINO 特征输入编码器并由各保留 token 前缀独立重建的可变长度视频 tokenizer,用于自回归视频生成。201M SemanTok AR 模型的表现可匹配或超过参数规模为其 3.4 倍的 VideoFlexTok AR 模型。SemanTok 的短 token 前缀预测成本更低且生成保真度更高,像素细节则延后到后续 token。
推荐理由
论文通过让每个保留 token 前缀独立重建冻结的 DINO 特征,提升自回归视频生成的语义对齐,并降低短前缀预测成本。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org