Templates

ZJU PI Thesis Proposal

Preview

ZJU PI Thesis Proposal

Thesis Proposal LaTeX unofficial template. 浙江大学工程师学院硕/博士学位开题报告非官方LaTeX模版

Category

university

License

Free to use (MIT)

File

main.tex

main.texRead-only preview
% !TEX root = ./main.tex
% !TEX program = xelatex
% NOTE: 为了更好的 Unicode 支持,请使用 XeLaTeX(或 LuaLaTeX)编译。
\documentclass[11pt]{article}
\usepackage{ctex}
\usepackage{fontspec}
\usepackage{xeCJK}
\setmainfont{CMU Serif}
\IfFontExistsTF{Noto Serif CJK SC}{\setCJKmainfont{Noto Serif CJK SC}}{%
  \IfFontExistsTF{Source Han Serif SC}{\setCJKmainfont{Source Han Serif SC}}{%
    \setCJKmainfont{FandolSong-Regular}% TeX Live fallback
  }%
}%
\IfFontExistsTF{FandolFang-Regular}{\setCJKfamilyfont{fs}{FandolFang-Regular}}{%
  \setCJKfamilyfont{fs}{FandolSong-Regular}%
}%

\usepackage[top=2.54cm,bottom=2.54cm,left=3.18cm,right=3.18cm]{geometry}
\usepackage{amsmath}
\usepackage{amssymb}
\usepackage{amsthm}
\usepackage{graphicx}
\usepackage{tikz-cd}
\usepackage{multicol}
\usepackage{setspace}
\usepackage{titlesec}
\usepackage{tikz}
\usepackage{booktabs}
\usepackage{caption}
\usepackage{cleveref}
% Configure cleveref for Chinese format (图 1, 表 1)
\crefname{figure}{图}{图}
\Crefname{figure}{图}{图}
\crefname{table}{表}{表}
\Crefname{table}{表}{表}
\crefname{equation}{式}{式}
\Crefname{equation}{式}{式}
\crefname{theorem}{定理}{定理}
\crefname{proposition}{命题}{命题}
\crefname{lemma}{引理}{引理}
\crefname{corollary}{推论}{推论}
\crefname{definition}{定义}{定义}
\crefname{remark}{注记}{注记}
\usepackage[backend=biber,style=gb7714-2015]{biblatex}
\addbibresource{references.bib}
% Customize bibliography title: centered, font size -2 (小二), Chinese title
\defbibheading{bibliography}[\bibname]{%
  \begin{center}\zihao{-2}\bfseries 参考文献\end{center}%
}
\setlength{\parindent}{2em}
\setlength{\parskip}{0pt}
\onehalfspacing
% Add 0.5 line space after section titles
\titlespacing*{\section}{0pt}{0pt}{0.5\baselineskip}
% Increased subsection before-space to 1.5\baselineskip to avoid collision with previous paragraph
\titlespacing*{\subsection}{0pt}{0.5\baselineskip}{0.5\baselineskip}
\titlespacing*{\subsubsection}{0pt}{0.5\baselineskip}{0.5\baselineskip}
% Ensure paragraph has proper spacing after heading
\titlespacing*{\paragraph}{0pt}{\baselineskip}{0.5em}

% Section numbering: Chinese characters for section, Arabic for sub/subsub
\renewcommand{\thesection}{\chinese{section}}
\renewcommand{\thesubsection}{\arabic{section}.\arabic{subsection}}
\renewcommand{\thesubsubsection}{\arabic{section}.\arabic{subsection}.\arabic{subsubsection}}

% TOC formatting
\makeatletter
\renewcommand{\tableofcontents}{%
  \section*{\begin{center}\zihao{2}\bfseries 目录\end{center}}%
  \@starttoc{toc}%
}
\makeatother

% Footnote formatting: use circled numbers ①, ②
\usepackage{pifont}
\renewcommand{\thefootnote}{\ding{\numexpr171+\value{footnote}}}

% Figure caption setup
\captionsetup{labelsep=space, font={small,bf}}

% Theorem environments
% Use independent Arabic numeral numbering (not section-dependent)
\newtheorem{theorem}{定理}
\newtheorem{proposition}{命题}
\newtheorem{lemma}{引理}
\newtheorem{corollary}{推论}
\theoremstyle{definition}
\newtheorem{definition}{定义}
\theoremstyle{remark}
\newtheorem{remark}{注记}

\begin{document}

% 页码从封面开始编号
\setcounter{page}{1}
\pagenumbering{arabic}

\begin{titlepage}
  \centering

  {\zihao{-2}\bfseries 浙江大学工程师学院硕士/博士研究生 \\ \vspace{0.2cm} 开题报告\par}

  \vspace{0.8cm}
  \includegraphics[width=3cm]{imgs/zjulogo.png}
  \vspace{1.2cm}

  \renewcommand{\arraystretch}{3}
  {\zihao{-4}
  \begin{tabular}{@{}l l@{}}
    中文论文题目: & \underline{\makebox[11cm][c]{软图扩散 Transformer MIMO 检测}} \\
    英文论文题目: & \underline{\makebox[11cm][c]{Soft Graph Diffusion Transformer for MIMO Detection}} \\
    姓\quad 名: & \underline{\makebox[11cm][c]{洪嘉栋}} \\
    学\quad 号: & \underline{\makebox[11cm][c]{22460005}} \\
    指导教师: & \underline{\makebox[11cm][c]{刘\quad 雷}} \\
    专业类别领域: & \underline{\makebox[11cm][c]{电子信息(新一代电子信息技术)}} \\
  \end{tabular}
  }

  \vfill
  {\zihao{-4}提交日期 \quad \today\par}
\end{titlepage}

\clearpage
\tableofcontents
\clearpage

\begin{center}
  {\zihao{-3}\bfseries 软图扩散 Transformer MIMO 检测}
\end{center}

\begin{center}
  {\zihao{-3}\bfseries 摘要}
\end{center}

{\setlength{\parindent}{2em}
针对多输入多输出(Multiple-Input Multiple-Output, MIMO)系统中传统检测算法计算复杂度高、性能受限的问题,本文提出一种基于软图扩散 Transformer 的新型接收机架构。该方法将 MIMO 检测问题建模为因子图上的消息传递过程,通过图感知 Tokenization 构建线性约束 Token 和符号 Token 的双部分图表示,利用自注意力捕获子图内上下文一致性,交叉注意力实现子图间定向消息传递。进一步,本文研究二元流匹配在 MIMO 检测中的应用,引入流匹配框架以实现对 MIMO 检测先验符号信息的免后训练使用,发现并形式化了信号空间预测与速度匹配损失之间的预测 - 损失空间不匹配问题,证明了该不匹配导致梯度方差发散的结构性奇点,提出了预测 - 损失空间对齐原则以实现稳定训练。仿真结果表明,在 8×8、8×16、16×16 MIMO 系统配置下,所提方法误码率性能优于传统 OAMPNet2 和 Transformer-based MIMO 检测器,同时保持可接受的计算复杂度。

{\CJKfamily{fs} 关键词:MIMO 检测、因子图、消息传递、图 Transformer 网络、注意力机制、扩散模型、流匹配、预测损失对齐}
}

\section{选题背景及意义}

\subsection{选题背景}

随着第五代移动通信(5G)技术的规模化商用和未来 6G 研究的深入,无线通信系统对频谱效率和能量效率的要求日益提高。MIMO-OFDM 技术作为当前无线通信系统的核心技术之一,通过在频域和空域同时传输多个数据流,显著提升了系统容量和链路可靠性\footnote{本研究得到国家自然科学基金项目(编号:62301485)和浙江省自然科学基金项目(编号:LZ25F010002)资助。}。然而,随着天线数量和子载波数目的增加,最优检测算法的计算复杂度呈指数级增长,如何在保证检测性能的同时降低计算复杂度,成为亟待解决的关键问题。

在 MIMO 接收机中,检测器的任务是从受噪声污染的接收信号中恢复出发送的符号向量。最大似然检测虽然能达到最优性能,但其计算复杂度随天线数呈指数增长 $O(M^{N_t})$,在实际系统中难以实现。传统的低复杂度检测算法如线性最小均方误差检测器计算简单但性能较差;基于消息传递的近似消息传递、正交 AMP 等算法虽然降低了复杂度,但其性能依赖于大系统渐近假设,在有限维度下表现脆弱。

近年来,深度学习技术在无线通信物理层的应用受到广泛关注。基于深度展开的 OAMPNet 系列算法通过学习算法参数提升了有限维度下的性能,但仍需要矩阵逆运算导致立方级复杂度。Transformer 架构因其强大的上下文建模能力被引入 MIMO 检测,但现有方法忽略了 MIMO 系统的因子图结构,且无法有效利用来自译码器或其他模块的软先验信息。

\subsection{研究意义}

本研究拟提出的软图扩散 Transformer 接收机,旨在融合图神经网络的消息传递机制、Transformer 的全局建模能力以及扩散模型的生成优势,为 MIMO 检测问题提供一种新的解决思路。

\begin{description}
\item[理论意义] 

建立因子图引导的 Transformer 注意力机制理论框架;提出二元流匹配的预测 - 损失空间对齐原则,证明该原则对一般流匹配模型的指导意义;揭示信号拓扑结构对损失函数选择的决定性作用。

\item[应用价值] 

研究成果可应用于 5G-Advanced 及 6G 系统的接收机设计;支持软输入 - 软输出(Soft Input Soft Output, SISO)接口,可与软输入译码器或其他检测模块无缝集成;为迭代接收机架构提供灵活构建模块。
\end{description}

\section{国内外研究现状}

\subsection{MIMO 检测研究现状}

MIMO 检测技术经历了从传统算法到深度学习方法的演进。本节综述三类主要方法:传统消息传递算法、深度展开方法和 Transformer 方法。

\paragraph{MIMO 系统模型。}
考虑一个窄带 MIMO 系统,其中发送端配备 $N_t$ 根发射天线,接收端配备 $N_r$ 根接收天线。发送符号向量 $\mathbf{x} \in \mathbb{C}^{N_t}$ 经过信道矩阵 $\mathbf{H} \in \mathbb{C}^{N_r \times N_t}$ 传输,接收信号向量 $\mathbf{y} \in \mathbb{C}^{N_r}$ 可表示为:
\begin{equation}
\mathbf{y} = \mathbf{H}\mathbf{x} + \mathbf{n}
\end{equation}
其中 $\mathbf{n} \sim \mathcal{CN}(0, \sigma^2\mathbf{I})$ 是复值加性高斯白噪声。MIMO 检测器的任务是从受噪声污染的接收信号 $\mathbf{y}$ 和已知信道 $\mathbf{H}$ 中恢复出发送符号 $\mathbf{x}$。

对于二进制调制(如 BPSK、QPSK),上述复值模型可以等效转换为实值模型:
\begin{equation}
\mathbf{y}_r = \mathbf{H}_r \mathbf{x}_r + \mathbf{n}_r
\end{equation}
其中 $\mathbf{y}_r, \mathbf{H}_r, \mathbf{x}_r, \mathbf{n}_r$ 分别是 $\mathbf{y}, \mathbf{H}, \mathbf{x}, \mathbf{n}$ 的实值表示。该 MIMO 系统可以用因子图表示,如\cref{fig:sgt-arch}(a) 所示,其中每个接收信号 $y_j$ 对应一个线性约束节点,每个发送符号 $x_i$ 对应一个变量节点。

\begin{itemize}
  \item \textbf{传统消息传递算法}:近似消息传递(Approximate Message Passing, AMP)\cite{donoho2009amp} 基于高斯近似假设,在大系统极限下能达到最优性能,但在有限维度下表现不稳定。正交 AMP(Orthogonal AMP, OAMP)\cite{ma2017oamp} 通过引入正交约束改善了收敛性,但仍依赖于信道矩阵的单位不变性假设。记忆 AMP(Memory AMP, MAMP)\cite{liu2021mamp} 通过引入记忆项构建 Taylor 展开,在不损失性能(与 OAMP 同为右酉不变矩阵下贝叶斯最优)的情况下大大降低了计算复杂度。

  \item \textbf{深度展开方法}:OAMPNet\cite{he2018oampnet,he2020oampnet2} 通过展开 OAMP 迭代结构并学习最优参数,在有限维度系统中实现了性能提升。然而,这些方法仍保留了矩阵逆运算模块,计算复杂度为 $O(K N_r N_t^2)$。

  \item \textbf{Transformer 方法}:RE-MIMO\cite{pratik2020remimo} 将循环网络与自注意力结合,在相关信道下表现出色。Ahmed 等人\cite{ahmed2025transformer} 提出了基于 QR 分解(正交三角分解)的 Transformer MIMO 检测器,有效处理了维度对齐问题,但忽略了 MIMO 因子图结构。

  \item \textbf{其他物理层数字通信中的图 Transformer 方法}:ECCT(Error Correction Code Transformer)\cite{yoni2022ecct} 首次将 Transformer 应用于信道解码,利用自注意力模拟 Tanner 图上的消息传递。CrossMPT\cite{park2025crossmpt} 进一步发展了交叉注意力机制,显式地在变量节点和校验节点之间进行定向消息传递。这些工作为图结构化 Transformer 在通信物理层的应用提供了重要参考。
\end{itemize}

综上所述,现有方法在复杂度与性能权衡方面仍存在局限,这为本文提出的软图扩散 Transformer 方法提供了研究空间。

\subsection{流匹配与扩散模型研究现状}

流匹配(Flow Matching)\cite{lipman2022flow,liu2022flow} 提供了统一的连续时间生成建模框架,通过构造时间依赖的概率路径将简单噪声分布传输到复杂数据分布。本节从连续流匹配、离散扩散模型和二元流匹配理论三个方面进行综述。

\begin{itemize}
  \item \textbf{连续流匹配}:JiT(Just Image Transformer)\cite{li2025back} 展示了在连续信号上采用信号空间预测($x$-prediction)配合速度匹配损失可达到最先进的性能。Stable Diffusion 3\cite{esser2024scaling} 采用了类似的架构设计。

  \item \textbf{离散扩散模型}:针对离散数据的扩散模型主要分为两类:一类是显式重设计离散状态空间转移核的方法\cite{austin2021d3pm,campbell2024generative};另一类是将二进制数据视为"Analog Bits"\cite{chenanalog},嵌入连续欧氏空间。

  \item \textbf{二元流匹配理论}:本研究发现了 $x$-prediction 与 $v$-loss 的耦合引入了时间依赖的奇异权重 $\lambda(t) = (1-t)^{-2}$,导致梯度方差发散。理论证明预测 - 损失空间对齐可消除奇异性,实现一致稳定的优化\cite{hong2026binary}。
\end{itemize}

综上所述,二元流匹配的预测 - 损失空间对齐问题尚未被系统研究,本文的理论工作填补了这一空白。

\section{主要研究方法}

\subsection{软图 Transformer 架构}

软图 Transformer(Soft Graph Transformer, SGT)~\cite{hong2026sgt}是一种软输入 - 软输出的神经架构,专为 MIMO 检测设计。SGT 将 MIMO 检测问题建模为因子图上的消息传递过程,通过图感知 Tokenization 构建双部分图表示,利用注意力机制实现上下文编码和消息传递。

\begin{figure}[htbp]
  \centering
  \includegraphics[width=\textwidth]{imgs/sgt-token-arch.png}
  \caption{软图 Transformer(SGT)整体架构。输入为软符号估计和原始接收特征,经过图感知 Tokenization 生成线性约束 Token 和符号 Token,通过多层 Transformer 块处理,输出比特级后验 LLR。}
  \label{fig:sgt-arch}
\end{figure}

如\cref{fig:sgt-arch}所示,SGT 的完整推理流程包括三个主要阶段:

\begin{itemize}
  \item \textbf{图感知 Tokenization}:从软符号估计和原始接收特征构建二部分图。线性约束 Token 表示接收端观测,符号 Token 表示发送端符号。

  \item \textbf{注意力即上下文编码与消息传递}:SGT 核心应用多层 Transformer 块,自注意力捕获子图内上下文一致性,交叉注意力实现子图间定向消息传递。

  \item \textbf{软输入 - 软输出接口}:处理软先验对数似然比(Log-Likelihood Ratio, LLR)输入并生成后验 LLR 输出,确保与软输入译码器兼容。
\end{itemize}

综上所述,SGT 通过图结构化 Token 表示和注意力机制,实现了高效的 MIMO 检测。

\subsection{因子图引导的注意力机制}

注意力机制在结构化图问题(如 MIMO 检测)中服务于两个互补目的:自注意力用于子图内上下文编码,交叉注意力用于子图间消息传递。

SGT 的注意力机制分为两类:

\begin{itemize}
  \item \textbf{自注意力}:在同质 Token 集内提供强大的上下文编码。给定 Token 集 $\{\mathbf{t}_j\}_{j=1}^N$,第 $j$ 个更新 Token 为:
  \begin{equation}
      \tilde{\mathbf{t}}_j = \sum_{k=1}^N \alpha_{jk}\,\mathbf{W}_V \mathbf{t}_k,
      \quad
      \alpha_{jk} = \text{softmax}\!\left(\frac{(\mathbf{W}_Q \mathbf{t}_j)^\top (\mathbf{W}_K \mathbf{t}_k)}{\sqrt{d_k}}\right)
  \end{equation}
  其中 $\mathbf{W}_Q, \mathbf{W}_K, \mathbf{W}_V$ 是可学习投影矩阵。

  \item \textbf{交叉注意力}:实现异质 Token 类型间的定向消息传递。对于来自一个子图的查询 Token $\mathbf{t}_j$ 和来自另一个子图的键值 Token $\mathbf{t}_i$,更新为:
  \begin{equation}
      \tilde{\mathbf{t}}_j = \sum_{i} \alpha_{ij}\,\mathbf{W}_V \mathbf{t}_i,
      \quad
      \alpha_{ij} = \text{softmax}\!\left(\frac{(\mathbf{W}_Q \mathbf{t}_j)^\top (\mathbf{W}_K \mathbf{t}_i)}{\sqrt{d_k}}\right)
  \end{equation}
\end{itemize}

\par\nopagebreak
类似地,在信道解码中,CrossMPT\cite{park2025crossmpt} 等方法已验证了交叉注意力在模拟 Tanner 图消息更新上的有效性。而在 MIMO 检测中,约束分布在两个同构子图上:线性约束子图和符号估计子图。因此,SGT 自然地结合子图内自注意力进行上下文编码和子图间交叉注意力进行定向消息传递。

\subsection{二元流匹配与预测 - 损失对齐}

流匹配通过构造连续概率路径将简单噪声分布传输到复杂数据分布。对于二进制数据,采用"Analog Bits"范式,将原始二值信息映射到双极性范围,使得前向插值过程可表示为时变 AWGN 信道。

\begin{figure}[htbp]
  \centering
  \includegraphics[width=0.7\textwidth]{imgs/fm-layout.png}
  \caption{条件流匹配示意图。通过构造线性概率路径将噪声分布逐步传输到数据分布。}
  \label{fig:fm-layout}
\end{figure}

如\cref{fig:fm-layout}所示,采用线性概率路径:
\begin{equation}
    \mathbf{z}_t = t \mathbf{x}_{gt} + (1 - t) \mathbf{e}, \quad \mathbf{e} \sim \mathcal{N}(0, \mathbf{I})
\end{equation}
对应的条件向量场为 $u_t(\mathbf{z}_t | \mathbf{x}_{gt}) = \dot{\mathbf{z}}_t = \mathbf{x}_{gt} - \mathbf{e}$。

对于二进制数据,采用"Analog Bits"范式,将原始二值信息 $\{0, 1\}^N$ 映射到双极性范围 $\{-1, 1\}^N$(对应 BPSK 调制)。这使得前向插值过程可表示为时变加性高斯白噪声(AWGN)信道,瞬时信噪比为 $\gamma(t) = t^2 / (1 - t)^2$。

\paragraph{预测 - 损失空间不匹配问题。}
$x$-prediction 与 $v$-loss 的耦合引入了时间依赖的奇异权重 $\lambda(t) = (1-t)^{-2}$。理论分析表明\cite{hong2026binary}:

\begin{theorem}[不匹配奇点]
考虑 $x$-prediction 在速度匹配损失下训练,均匀时间采样 $t \sim \mathcal{U}[0, 1]$。在有限 Lipschitz 容量和非退化雅可比假设下,累积梯度方差 $\mathcal{I} = \int_0^1 \mathbb{E}[\|\mathbf{g}_t(\theta)\|^2] dt$ 对于所有标准化流形均发散:
\begin{enumerate}
  \item 对于连续相关信号,$\mathcal{I}$ 呈现一阶发散 $\mathcal{O}((1-t)^{-1})$
  \item 对于二进制信号,$\mathcal{I}$ 呈现三阶发散 $\mathcal{O}((1-t)^{-3})$
\end{enumerate}
\end{theorem}

\textit{证明概要。} 积分 $\mathcal{I} \propto \int_0^1 (1-t)^{-4} R(t) dt$ 由残差 $R(t)$ 在 $t \to 1$ 时的渐近行为决定。对于连续信号,$R(t) \sim (1-t)^2$ 部分正则化被积函数至 $(1-t)^{-2}$。对于二进制数据,持久近似误差 $R(t) \sim \Omega(1)$ 使 $(1-t)^{-4}$ 项未被补偿,触发爆炸性发散。

\paragraph{预测 - 损失空间对齐原则。}
解决方案是实现预测 - 损失空间对齐:将损失函数从速度空间移回信号空间($x$-loss),可解析消除奇异性。

\begin{proposition}[对齐配置的一致性稳定性]
考虑对齐配置,其中目标函数定义在网络的预测空间中。在有限 Lipschitz 容量假设下,随机梯度 $\mathbf{g}_t$ 一致有界,确保与采样器无关的稳定性:
\begin{enumerate}
  \item 对于连续流形,速度对齐($v$-pred + $v$-loss)和信号对齐($x$-pred + MSE-loss)均产生 $\mathbb{E}[\|\mathbf{g}_t\|^2] = \mathcal{O}(1)$
  \item 对于二进制流形,使用 MSE 或 BCE 目标的信号对齐产生 $\mathbb{E}[\|\mathbf{g}_t\|^2] = \mathcal{O}(1)$,有效消除三阶发散
\end{enumerate}
\end{proposition}

\textit{证明概要。} 对齐确保代数因子 $(1-t)^{-2}$ 从梯度 $\mathbf{g}_t$ 中消失。在连续域中,这恢复了 JiT 推广的 $x$-prediction 范式的稳定性。在二进制域中,对齐防止非消失残差 $R(t) \sim \Omega(1)$ 触发不匹配奇点,允许在均匀采样下稳健收敛。

该理论结果对一般流匹配模型具有指导意义:\textbf{预测 - 损失空间对齐是实现稳定训练的结构性解决方案},不依赖于特殊的采样策略(如 Logit-Normal 采样)。

\subsection{拓扑感知的损失设计}

一旦实现对齐,最优损失设计由信号拓扑决定。对于不同的信号结构和任务需求,应选择不同的损失函数。本文基于 TensorFlow 框架实现实验验证\cite{abadi2016tensorflow}。

\paragraph{二元交叉熵(Binary Cross-Entropy, BCE)。}
BCE 对应因子化 Bernoulli 模型的负对数似然:
\begin{equation}
  \mathcal{L}_{\mathrm{BCE}}(\mathbf{x}, \hat{\mathbf{x}})
  = - \sum_{i=1}^D \left[
  \frac{1+x_i}{2} \log p_i + \frac{1-x_i}{2} \log (1-p_i)
  \right]
\end{equation}
其中 $p_i = \sigma(\hat{x}_i)$。BCE 假设给定模型输出下比特间的条件独立性,适用于独立符号恢复(MIMO 检测)。

\paragraph{均方误差(Mean Squared Error, MSE)。}
MSE 对应各向同性高斯模型的负对数似然:
\begin{equation}
  \mathcal{L}_{\mathrm{MSE}}(\mathbf{x}, \hat{\mathbf{x}})
  = \|\mathbf{x} - \hat{\mathbf{x}}\|_2^2
\end{equation}
MSE 将二进制信号视为连续欧氏空间中的单点,强制所有维度间的全局几何一致性,隐式保留空间或结构相关性,适用于二值图像等空间相关结构。

综上所述,MIMO 检测任务中符号间近似独立,因此选择 BCE 损失更为合适;而对于空间相关结构(如图像),MSE 能更好地保留几何一致性。实证研究表明,在 MIMO 这种符号/比特严格独立同分布(IID)的数据拓扑情况下,BCE 表现最优。

\section{主要研究内容及创新点}

\subsection{主要研究内容}

本研究围绕软图扩散 Transformer MIMO 检测展开,主要包括因子图引导的 Transformer 架构设计、流匹配理论分析、软输入 - 软输出接口实现和复杂度与性能权衡分析四个方面。

\begin{itemize}
  \item \textbf{因子图引导的 Transformer 架构设计}:研究 MIMO 系统因子图的 Tokenization 机制,设计双部分图表示(线性约束 Token + 符号 Token)。实现自注意力与交叉注意力的协同:自注意力捕获子图内上下文,交叉注意力实现子图间消息传递。

  \item \textbf{流匹配在二进制流形上的理论分析}:形式化预测 - 损失空间不匹配问题,给出严格的数学刻画。证明梯度方差发散的阶数定理,分析 Logit-Normal 采样 implicit 稳定化机制。引入流匹配框架以实现对 MIMO 检测先验符号信息的免后训练使用。

  \item \textbf{软输入 - 软输出接口实现}:设计先验 LLR 信息的嵌入与融合机制,实现后验 LLR 输出生成。支持与软输入软输出(Soft Input Soft Output, SISO)译码器或其他检测模块的无缝集成。

  \item \textbf{复杂度与性能权衡分析}:与 ML、OAMP、Transformer-based MIMO 进行复杂度对比。评估不同 MIMO 系统规模(8×8, 8×16, 16×16)下的性能表现。
\end{itemize}

综上所述,本研究从架构设计、理论分析、接口实现到性能评估形成了完整的研究链条。

\subsection{创新点}

本研究的创新点包括因子图引导的注意力机制、预测 - 损失空间对齐原则、拓扑感知的损失设计和统一的软输入 - 软输出框架四个方面。

\begin{itemize}
  \item \textbf{因子图引导的注意力机制}:首次将 MIMO 因子图结构显式编码到 Transformer 注意力机制中。自注意力捕获子图内上下文,交叉注意力实现子图间消息传递。

  \item \textbf{预测 - 损失空间对齐原则}:发现并形式化了 $x$-prediction 与 $v$-loss 的空间不匹配问题。证明该不匹配导致梯度方差发散的结构性奇点,提出信号空间损失作为结构性解决方案。该原则对一般流匹配模型具有指导意义。

  \item \textbf{拓扑感知的损失设计}:揭示信号拓扑结构决定最优损失函数选择。为 MIMO 检测任务选择 BCE 损失提供理论依据。

  \item \textbf{统一的软输入 - 软输出框架}:支持外部软先验信息的 principled 融合。可作为迭代接收机架构的灵活构建模块。
\end{itemize}

综上所述,本研究在架构创新、理论贡献和实用价值三个层面均有实质性突破。

\section{研究方案}

\subsection{理论分析与建模}

本阶段主要工作包括 MIMO 系统因子图建模、流匹配概率路径设计和预测 - 损失空间对齐的理论证明。预期成果为完整的数学框架和梯度方差发散性定理及证明。

\begin{itemize}
  \item MIMO 系统因子图建模:建立 $\mathbf{y} = \mathbf{H}\mathbf{x} + \mathbf{n}$ 的因子图表示
  \item 流匹配概率路径设计:构造从噪声到信号的连续时间传输路径
  \item 预测 - 损失空间对齐的理论证明:给出梯度方差收敛性定理
\end{itemize}

\subsection{算法设计与实现}

本阶段主要工作包括 SGT 网络架构实现、二元流匹配训练框架和软输入 - 软输出接口模块。关键技术包括图感知 Tokenization、交替自注意力与交叉注意力层、位置编码与前馈网络(Feed-Forward Network, FFN)设计。

\begin{itemize}
  \item SGT 网络架构实现(PyTorch):包括 Tokenization、注意力层、FFN 模块
  \item 二元流匹配训练框架:实现 $x$-prediction 与 $x$-loss 的对齐配置
  \item 软输入 - 软输出接口模块:LLR 嵌入与输出生成
\end{itemize}

\subsection{仿真验证与性能评估}

本阶段通过仿真验证 SGT 方法的性能,并与其他基线方法进行对比评估。主要评估指标为误码率(Bit Error Rate, BER)、计算复杂度(FLOPs)和推理时间。

\begin{table}[htbp]
\centering
\small
\caption{不同 MIMO 检测方法的 GPU 运行时和计算复杂度对比}
\label{tab:comparison}
\begin{tabular}{lcccc}
\toprule
方法 & \multicolumn{3}{c}{GPU 运行时(秒/1000 样本)} & 计算复杂度 \\
\cmidrule(lr){2-4}
     & 8×8 & 8×16 & 16×16 & \\
\midrule
线性最小均方误差(LMMSE) & 0.00679 & 0.00718 & 0.00742 & $O(N_r N_t^2)$ \\
正交 AMP(OAMP) & 0.02208 & 0.02234 & 0.02408 & $O(K N_r N_t^2)$ \\
OAMPNet2 & 0.03333 & 0.03415 & 0.03507 & $O(K N_r N_t^2)$ \\
最大似然(ML) & 2.10082 & 2.13612 & -- & $O(M^{N_t})$, $M=2^{N_{\text{bits}}}$ \\
Transformer-based MIMO & 0.03844 & 0.03924 & 0.04028 & $O(N_r N_t^2 + L N_t^2 d_{\text{model}})$ \\
Transformer(消融) & 0.03560 & 0.03494 & 0.03593 & $O(N_r N_t^2 + L N_t^2 d_{\text{model}})$ \\
SGT(本文) & 0.09351 & 0.09464 & 0.09498 & $L \cdot O(N_r^2 + N_t^2 + N_r N_t) \cdot d_{\text{model}}$ \\
\bottomrule
\end{tabular}
\end{table}

如\cref{tab:comparison}所示,SGT 在 GPU 上的推理时间与 OAMPNet2 和 Transformer-based MIMO 相当,同时提供更优的 BER 性能。复杂度分析表明,Transformer-based MIMO 由于 QR 分解预处理呈现立方复杂度,OAMP/OAMPNet 由于矩阵逆运算也呈现立方复杂度,而 SGT 在超大规模系统中展现出更优的二次复杂度增长特性。

\begin{figure}[htbp]
  \centering
  \includegraphics[width=\textwidth]{imgs/ab-stdy.png}
  \caption{SGT 消融实验结果。在不同 MIMO 系统配置下验证图感知 Tokenization 和交叉注意力的有效性。}
  \label{fig:ablation}
\end{figure}

\begin{figure}[htbp]
  \centering
  \includegraphics[width=\textwidth]{imgs/mimo-loss-ber-merged.png}
  \caption{流匹配训练原则实证研究结果。(a)流匹配 SGT 推理结构;(b)Align 配置使训练稳定;(c)(d)BCE Aligned 在 MIMO 检测任务中表现最优。}
  \label{fig:fm-empirical}
\end{figure}

如\cref{fig:ablation}所示,消融实验验证了图感知 Tokenization 和交叉注意力的有效性。\cref{fig:fm-empirical}展示了流匹配训练原则的实证研究结果:一方面验证了 SGT 在不同 MIMO 系统配置下的 BER 性能优势,另一方面证实了对于 MIMO 检测这种符号/比特严格独立同分布(IID)的数据拓扑结构,BCE 损失函数表现最优。结合\cref{tab:comparison}的复杂度和运行时分析,SGT 实现了性能与效率的最佳权衡。

\section{预期成果}

\subsection{学术论文}

本研究计划发表两篇学术论文,分别涵盖 SGT 架构设计和二元流匹配理论两个方面。

\begin{itemize}
  \item \textbf{Soft Graph Transformer for MIMO Detection}:会议:ICASSP 2026(信号处理旗舰会议,已接收待出版)。贡献:基于消息传递机制启发提出了一个因子图引导的强可解释 Transformer MIMO检测器架构,在小规模MIMO下达到了SOTA性能。

  \item \textbf{Binary Flow Matching: Prediction-Loss Space Alignment for Robust Learning}:会议:已投递至某人工智能相关会议(在审)。贡献:预测 - 损失空间对齐理论,证明该原则对一般流匹配模型的指导意义,讨论了流匹配范式的二元化转移中的损失函数选择与数据分布拓扑问题,在多个二元流匹配场景(包括MIMO检测)中进行了实证验证,证明了理论的正确性。
\end{itemize}

\subsection{原型系统}

本研究将开发完整的软件原型系统,包括 TensorFlow 实现的训练与推理代码和模块化 SGT 组件库。潜在应用包括 5G/6G 接收机仿真平台和迭代检测 - 译码系统集成。

\begin{itemize}
  \item 软件实现:TensorFlow 实现的完整训练与推理代码,模块化 SGT 组件库
  \item 潜在应用:5G/6G 接收机仿真平台,迭代检测 - 译码系统集成
\end{itemize}

综上所述,本研究预期在学术论文和原型系统两个方面均取得实质性成果。

% \clearpage
\printbibliography

\end{document}
Preview
ZJU PI Thesis Proposal preview
ZJU PI Thesis Proposal LaTeX Template | Bibby | Bibby AI