<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>论文阅读 on 郭睿的博客</title><link>https://low-hands.github.io/zh-cn/posts/paper/</link><description>Recent content in 论文阅读 on 郭睿的博客</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Sat, 14 Mar 2026 00:16:00 -0800</lastBuildDate><atom:link href="https://low-hands.github.io/zh-cn/posts/paper/index.xml" rel="self" type="application/rss+xml"/><item><title>Diffusion LLM paper reading</title><link>https://low-hands.github.io/zh-cn/posts/paper/dllm/</link><pubDate>Sat, 14 Mar 2026 00:16:00 -0800</pubDate><guid>https://low-hands.github.io/zh-cn/posts/paper/dllm/</guid><description>&lt;h1 id="1-residual-context-diffusion-language-models"&gt;1 Residual Context Diffusion Language Models&lt;/h1&gt;
&lt;h2 id="方法"&gt;方法&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;传统dLLM在每轮预测的时候会把没有预测到的位置上的[MASK]直接扔掉，重置为新的空白[MASK]；为了不浪费算力，会选择保留这些废弃的语义，转变成向量用于下一轮预测&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="算法"&gt;算法&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;将模型预测的概率与词向量进行加权求和，生成残差向量：&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$ \Delta_i^{(t_k)} = \sum_{j=1}^V p_{i,j}^{(t_k)} E_{j,:} $&lt;/p&gt;
&lt;p&gt;$E_{j}$是该词的词向量&lt;/p&gt;
&lt;ol start="2"&gt;
&lt;li&gt;残差向量的权重，来判断这个向量值不值得保留&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;$\alpha_i^{(t_k)} = \frac{-\sum_{j=1}^V p_{i,j}^{(t_k)} \log p_{i,j}^{(t_k)}}{\log V}$&lt;/p&gt;
&lt;p&gt;$\alpha$越大，模型对这个词可能越没把握，越应该保留；如果有把握的词都没有被预测，说明可能不应该继续保留&lt;/p&gt;
&lt;p&gt;$logV$用来把$\alpha$压缩到0-1之间&lt;/p&gt;
&lt;ol start="3"&gt;
&lt;li&gt;如果位置i的词没有被预测出来，就做残差相加，把残差项加到[MASK]上&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;如果已经被预测出来了，就是等于该词的词向量&lt;/p&gt;
&lt;p&gt;$\tilde{e}&lt;em&gt;i^{(t_k)} = \begin{cases} (1 - \alpha_i^{(t&lt;/em&gt;{k-1})})E(x_i^{(t_k)}) + \alpha_i^{(t_{k-1})}\Delta_i^{(t_{k-1})}, &amp;amp; \text{if } x_i^{(t_k)} = \text{[MASK]} \ E(x_i^{(t_k)}), &amp;amp; \text{otherwise} \end{cases}$&lt;/p&gt;
&lt;h2 id="训练"&gt;训练&lt;/h2&gt;
&lt;h3 id="1-reference-model-initialization"&gt;1 Reference Model Initialization&lt;/h3&gt;
&lt;p&gt;训练一个$\mathcal{M}_{ref}$，冻结所有参数，用来输出 $p^{(t)}$&lt;/p&gt;
&lt;h3 id="2-residual-aware-target-training"&gt;2 Residual-Aware Target Training&lt;/h3&gt;
&lt;p&gt;训练一个$\mathcal{M}_{target}$，输入为一个带[MASK]的句子&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;通过$\mathcal{M}_{ref}$算出来的概率，算出残差向量的权重$\alpha$&lt;/li&gt;
&lt;li&gt;$ \Delta_i^{(t_k)} = \sum_{j=1}^V p_{i,j}^{(t_k)} E_{j,:} $ 计算词向量，概率由 $\mathcal{M}&lt;em&gt;{ref}$ 得到，词向量来自$\mathcal{M}&lt;/em&gt;{target}$&lt;/li&gt;
&lt;li&gt;计算最终的加权结果作为输入&lt;/li&gt;
&lt;li&gt;输入到$\mathcal{M}&lt;em&gt;{target}$，预测无掩码的原句
损失函数：$\mathcal{L} = \mathbb{E}\left[\frac{1}{t}\sum&lt;/em&gt;{i:m_i=1} -\log P_{\theta_{target}}(x_i^{(0)} | {e_{i&amp;rsquo;}^{(t)}}_{i&amp;rsquo;=1}^b)\right]$&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="推理"&gt;推理&lt;/h2&gt;
&lt;h3 id="1-warm-start"&gt;1 Warm-Start&lt;/h3&gt;
&lt;p&gt;$\mathcal{M}_{ref}$输出第一步的概率分布$p^{(t_0)}$&lt;/p&gt;</description></item><item><title>Yan:Foundational Interactive Video Generation</title><link>https://low-hands.github.io/zh-cn/posts/paper/yan/</link><pubDate>Mon, 09 Feb 2026 00:16:00 -0800</pubDate><guid>https://low-hands.github.io/zh-cn/posts/paper/yan/</guid><description>&lt;h1 id="abstract"&gt;Abstract&lt;/h1&gt;
&lt;h1 id="introduction"&gt;Introduction&lt;/h1&gt;
&lt;p&gt;第一段主要说igv的应用和缺陷。aigc正在从生成文本和图像到视频合成（synthesis），现在在已经发展到交互视频生成（IGV）。IGV要求动态地对用户输入进行反应，应用范围从虚拟仿真到具身智能。但是当前方法的缺陷在于缺乏高视觉保真度（fidelity）、持续的时间连贯性（coherence）、丰富的交互性（interactivity）。生成的内容也在创建后保持静态，无法实时地适应。（不高清、不连贯、不交互）&lt;/p&gt;
&lt;p&gt;第二段详细讲述现存方法的缺点。GameNGen、PlayGen、MineWorld的视频质量和泛化能力不行；The-Matrix、GameFactory、Matrix-Game缺乏复杂（intricate）的物理仿真，实时性也不好。最重要的是这些方法把交互视频当成固定的内容生成，不支持动态编辑。列出三个核心挑战：&lt;strong&gt;1. 高保真度的实时视觉体验&lt;/strong&gt;；&lt;strong&gt;2. 泛化好，prompt可控的生成&lt;/strong&gt;；&lt;strong&gt;3. 交互过程中动态、交互的编辑以及即时内容的定制&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;ol&gt;
&lt;li&gt;高保真（高分辨、细节真实感、时间连贯）的画面&lt;/li&gt;
&lt;li&gt;实时：高帧率的情况下要迅速生成（Latency必须小）；&lt;/li&gt;
&lt;li&gt;泛化能力好&lt;/li&gt;
&lt;li&gt;on-the-fly：不停止运行，在执行的过程中修改&lt;/li&gt;
&lt;li&gt;是能够实时editing的，可以切换风格并且可以交互&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;传统游戏是通过计算产生下一帧的，比如物理引擎用于计算角色在重力作用下会跳高多少cm；通过逻辑计算判断是否会掉下去或者撞墙；通过gpu进行渲染一个像素一个像素地画出画面&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;第三段讲述本文提出的YAN架构。基于的数据集是Yuan_Meng_Star。主要分为三个模块：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;AAA-level Simulation: 利用高压缩、低时延的3D-VAE，结合基于KV-cache的shift-window降噪推理过程，实现1080p/60fps性能&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;3D-VAE:视频压缩包，把高清画面压小，处理起来才快&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;KV-cache: 缓存之前“想过”的信息，只关注正在变化的小window&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol start="2"&gt;
&lt;li&gt;Multi-modal Generation: 分层打标(hierarchical captioning)，游戏特有知识注入到视频扩散模型&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;支持文本和图像的多模态&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ol start="3"&gt;
&lt;li&gt;Multi-granularity Editing: 混合架构显式地将交互力学模拟和视觉渲染解耦(disentangles)，支持在任何时刻对视频进行编辑&lt;/li&gt;
&lt;/ol&gt;
&lt;blockquote&gt;
&lt;p&gt;解耦将玩家的操作动作和画面解耦开&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h1 id="related-work"&gt;Related-Work&lt;/h1&gt;
&lt;h2 id="interactive-generative-video"&gt;Interactive Generative Video&lt;/h2&gt;
&lt;p&gt;先前的IGV工作主要分成两部分。第一种是基于游戏的IGV，它把在游戏数据集里学习到的动作控制和结构transfer到开放（open-ended）环境中，它在某些场景下表现出泛化能力，依赖动作标注。但是这一类不是真正逐帧（frame-wise）的交互式。&lt;/p&gt;
&lt;blockquote&gt;
&lt;ol&gt;
&lt;li&gt;不逐帧: 成块控制的（chunked control），而不是逐帧生成的（每一帧画面基于上一帧画面和当前的动作信号），比如按下一个键执行这个动作的期间按其他键是不起作用的（动作指令被打包了）&lt;/li&gt;
&lt;li&gt;high latency: 高延迟，按下键后画面不会立刻反应（时间太长）&lt;/li&gt;
&lt;li&gt;更注重navigation（导航）而缺乏精确的物理效果&lt;/li&gt;
&lt;li&gt;画质不行&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;p&gt;第二种是真实世界的世界模型。它可以在受控制的情况下预测未来的帧的内容，但是不是prompt controllable的也无法提供实时的动作响应。&lt;/p&gt;
&lt;blockquote&gt;
&lt;ol&gt;
&lt;li&gt;无法即时控制&lt;/li&gt;
&lt;li&gt;无法根据prompt修改内容&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="game-simulation-with-nerual-network"&gt;Game Simulation with Nerual Network&lt;/h2&gt;
&lt;p&gt;传统游戏是代码写死的，这一方面的研究是想让AI通过阅读大量视频学会游戏的逻辑。MarioVGG通过基于文本的action和游戏的第一帧生成游戏视频片段，但是不实时（生成速度比播放速度慢很多）。GameGen、PlayGen、Oasis用Diffusion实现20FPS的游戏模拟（分辨率和帧率都很低）。本作实现60FPS/1080P。&lt;/p&gt;
&lt;h2 id="video-editing"&gt;Video Editing&lt;/h2&gt;
&lt;p&gt;基于diffusion model的视频编辑可以保持时空相干性（spatiotemporal coherence）。但是问题是假设用户输入是非交互式的，不能保证生成的内容可以实时反应用户的操作。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;时空相干性：视频改完后画面不能闪烁，物体形状不能崩塌。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;过去的研究很多都集中在高画质上没有考虑实时编辑。YAN将机制模拟器和视觉渲染解耦（多粒度）。机制模拟器处理物理特性和交互性，文本提示的视觉渲染根据输入的文本处理风格。&lt;/p&gt;
&lt;h1 id="overview"&gt;Overview&lt;/h1&gt;
&lt;p&gt;数据集源于3d游戏环境中的自动采集的交互式视频数据集。系统是端到端的，分为三个模块。&lt;/p&gt;
&lt;h2 id="yan-sim3a级模拟"&gt;Yan-Sim：3A级模拟&lt;/h2&gt;
&lt;p&gt;高画质、实时渲染和物理模拟&lt;/p&gt;
&lt;h2 id="yan-gen-多模态生成"&gt;Yan-Gen： 多模态生成&lt;/h2&gt;
&lt;p&gt;prompt controllable并且可以通过文字或者图像生成视频&lt;/p&gt;
&lt;h2 id="yan-edit-多粒度编辑"&gt;Yan-Edit： 多粒度编辑&lt;/h2&gt;
&lt;p&gt;把交互机制模拟和视觉渲染解耦（stucture and style）&lt;/p&gt;</description></item></channel></rss>