# 引言 在 STM32F4 系列(如 STM32F407)上,Cortex-M4 内核集成了可选的 L1-Cache(ART 加速器实际是 Flash 缓存,但 SRAM 区域默认无 Cache,除非使用外部 SDRAM 或开启 D-Cache)。然而,很多开发者在使用 DMA 时,会忽略 Cache 与 DMA 之间的数据一致性风险,尤其在双缓冲(Double Buffer)模式下,数据错乱、性能下降甚至系统崩溃的陷阱层出不穷。本文将从原理出发,剖析陷阱根源,并给出基于 CMSIS 的完整规避方案。 # 1. 原理:Cache 与 DMA 的交互 STM32F4 的 Cortex-M4 内核支持可选的 D-Cache(数据缓存)和 I-Cache(指令缓存),但默认在内部 SRAM 上不启用(因为 SRAM 访问延迟低)。当使用外部存储器(如 SDRAM)或开启 D-Cache 时,CPU 读写内存会先经过 Cache,而 DMA 是直接访问内存(外设到内存或内存到内存),不经过 Cache。 - **DMA 写入内存**:DMA 将数据从外设搬运到内存,但 Cache 中可能存有旧数据(脏数据),CPU 读取时可能命中 Cache,得到旧值。 - **DMA 读取内存**:CPU 先写数据到内存(可能只更新了 Cache),DMA 直接读取物理内存,可能读到未更新的数据。 因此,必须通过软件维护 Cache 的一致性: - **Clean(清理)**:将 Cache 中修改的数据写回内存,使内存与 Cache 一致。 - **Invalidate(失效)**:使 Cache 行失效,下次读取时从内存重新加载。 # 2. 双缓冲设计的典型陷阱 双缓冲(Ping-Pong)模式是 DMA 常用的一种高效传输方式,两个缓冲区交替使用,一个用于 DMA 写入,另一个供 CPU 处理。但在 Cache 存在时,以下陷阱极易出现: ## 陷阱 1:伪共享(False Sharing) 当两个缓冲区在内存中相邻,且共享同一个 Cache Line(通常 32 字节)时,CPU 对 Buffer A 的修改会导致 Buffer B 所在的 Cache Line 被标记为脏,DMA 写入 Buffer B 时,Cache 中的脏数据可能被意外写回,覆盖 DMA 新数据。 **规避**:确保每个缓冲区按 Cache Line 大小对齐(如 32 字节),并隔离填充。 ## 陷阱 2:脏数据覆盖(Dirty Data Overwrite) CPU 处理完 Buffer A 后,修改了其中部分数据(写入 Cache),但未 Clean 就切换 DMA 到 Buffer A 写入新数据,DMA 直接写内存,而 Cache 中的脏数据在后续 Invalidate 时被丢弃,导致 CPU 的修改丢失。 **规避**:在 DMA 开始写入前,必须对目标缓冲区执行 Clean(若 CPU 有修改)或 Invalidate(若 CPU 只读)。 ## 陷阱 3:缓冲切换竞态(Race Condition) 在双缓冲切换时,如果 CPU 在 DMA 还在写当前缓冲区时就切换指针,可能导致 DMA 写入一半的数据被 CPU 读取,造成数据撕裂。 **规避**:使用 DMA 传输完成中断,在中断中切换缓冲区,并确保切换操作与 Cache 维护顺序正确。 # 3. 配置步骤与代码实现 以下以 STM32F407 + 外部 SDRAM(启用 D-Cache)为例,演示双缓冲 DMA 的正确设计。 ## 3.1 内存属性配置 在系统初始化时,将 SDRAM 区域配置为 Cacheable(可缓存)或 Non-cacheable。推荐将 DMA 缓冲区放在 Non-cacheable 区域,但若必须使用 Cacheable,则需手动维护。这里我们采用 Cacheable 并手动维护。 ```c // 缓冲区定义,按 32 字节对齐 #define BUFFER_SIZE 1024 #define CACHE_LINE_SIZE 32 __attribute__((aligned(CACHE_LINE_SIZE))) uint8_t buffer_a[BUFFER_SIZE]; __attribute__((aligned(CACHE_LINE_SIZE))) uint8_t buffer_b[BUFFER_SIZE]; // 使能 D-Cache(在 SystemInit 后调用) SCB_EnableDCache(); ``` ## 3.2 DMA 双缓冲配置 使用 STM32F4 的 DMA2 流 0,配置为双缓冲模式,从 ADC 或 UART 接收数据。 ```c void DMA_Config(void) { // 使能 DMA2 时钟 RCC_AHB1PeriphClockCmd(RCC_AHB1Periph_DMA2, ENABLE); DMA_InitTypeDef DMA_InitStruct; DMA_StructInit(&DMA_InitStruct); DMA_InitStruct.DMA_Channel = DMA_Channel_0; DMA_InitStruct.DMA_PeripheralBaseAddr = (uint32_t)&ADC1->DR; DMA_InitStruct.DMA_Memory0BaseAddr = (uint32_t)buffer_a; DMA_InitStruct.DMA_DIR = DMA_DIR_PeripheralToMemory; DMA_InitStruct.DMA_BufferSize = BUFFER_SIZE; DMA_InitStruct.DMA_PeripheralInc = DMA_PeripheralInc_Disable; DMA_InitStruct.DMA_MemoryInc = DMA_MemoryInc_Enable; DMA_InitStruct.DMA_PeripheralDataSize = DMA_PeripheralDataSize_HalfWord; DMA_InitStruct.DMA_MemoryDataSize = DMA_MemoryDataSize_HalfWord; DMA_InitStruct.DMA_Mode = DMA_Mode_Circular; DMA_InitStruct.DMA_Priority = DMA_Priority_High; DMA_InitStruct.DMA_FIFOMode = DMA_FIFOMode_Disable; DMA_InitStruct.DMA_MemoryBurst = DMA_MemoryBurst_Single; DMA_InitStruct.DMA_PeripheralBurst = DMA_PeripheralBurst_Single; DMA_Init(DMA2_Stream0, &DMA_InitStruct); // 配置双缓冲 DMA_DoubleBufferModeConfig(DMA2_Stream0, (uint32_t)buffer_b, DMA_Memory_1); DMA_DoubleBufferModeCmd(DMA2_Stream0, ENABLE); // 使能传输完成中断 DMA_ITConfig(DMA2_Stream0, DMA_IT_TC, ENABLE); // 使能 DMA 流 DMA_Cmd(DMA2_Stream0, ENABLE); } ``` ## 3.3 Cache 维护操作 在 DMA 传输完成中断中,根据当前使用的缓冲区(通过 DMA_GetCurrentMemoryTarget 获取),执行 Invalidate 操作,使 CPU 能读到最新数据。注意:在 DMA 开始写入前,如果 CPU 曾修改过该缓冲区,需要先 Clean。 ```c void DMA2_Stream0_IRQHandler(void) { if (DMA_GetITStatus(DMA2_Stream0, DMA_IT_TC)) { DMA_ClearITPendingBit(DMA2_Stream0, DMA_IT_TC); // 获取当前 DMA 正在使用的缓冲区(另一块是 CPU 可用的) uint32_t current_target = DMA_GetCurrentMemoryTarget(DMA2_Stream0); uint8_t *active_buf = (current_target == DMA_Memory_0) ? buffer_b : buffer_a; // 使 active_buf 的 Cache 失效,确保 CPU 读取时从内存加载最新 DMA 数据 SCB_InvalidateDCache_by_Addr((uint32_t*)active_buf, BUFFER_SIZE); // 处理数据(例如打印或计算) ProcessBuffer(active_buf, BUFFER_SIZE); // 如果 CPU 修改了 active_buf,在下次 DMA 写入前需要 Clean // 但这里我们只读,所以无需 Clean。若需修改,则调用 SCB_CleanDCache_by_Addr。 } } ``` 注意:`SCB_InvalidateDCache_by_Addr` 要求地址按 32 字节对齐,且长度最好为 32 的倍数,否则需手动处理边界。 ## 3.4 完整示例:UART 接收双缓冲 以下是一个完整的 UART DMA 双缓冲接收示例,包含初始化、中断处理和主循环。 ```c // 全局变量 volatile uint8_t data_ready = 0; uint8_t *current_buf; void UART_DMA_Init(void) { // 使能 GPIOA、USART1、DMA2 时钟 RCC_AHB1PeriphClockCmd(RCC_AHB1Periph_GPIOA | RCC_AHB1Periph_DMA2, ENABLE); RCC_APB2PeriphClockCmd(RCC_APB2Periph_USART1, ENABLE); // GPIO 配置:TX=PA9, RX=PA10 GPIO_InitTypeDef GPIO_InitStruct; GPIO_InitStruct.GPIO_Pin = GPIO_Pin_9 | GPIO_Pin_10; GPIO_InitStruct.GPIO_Mode = GPIO_Mode_AF; GPIO_InitStruct.GPIO_Speed = GPIO_Speed_50MHz; GPIO_InitStruct.GPIO_OType = GPIO_OType_PP; GPIO_InitStruct.GPIO_PuPd = GPIO_PuPd_UP; GPIO_Init(GPIOA, &GPIO_InitStruct); GPIO_PinAFConfig(GPIOA, GPIO_PinSource9, GPIO_AF_USART1); GPIO_PinAFConfig(GPIOA, GPIO_PinSource10, GPIO_AF_USART1); // USART1 配置:115200, 8N1 USART_InitTypeDef USART_InitStruct; USART_InitStruct.USART_BaudRate = 115200; USART_InitStruct.USART_WordLength = USART_WordLength_8b; USART_InitStruct.USART_StopBits = USART_StopBits_1; USART_InitStruct.USART_Parity = USART_Parity_No; USART_InitStruct.USART_HardwareFlowControl = USART_HardwareFlowControl_None; USART_InitStruct.USART_Mode = USART_Mode_RX | USART_Mode_TX; USART_Init(USART1, &USART_InitStruct); // DMA 配置:流 2,通道 4(USART1_RX) DMA_InitTypeDef DMA_InitStruct; DMA_StructInit(&DMA_InitStruct); DMA_InitStruct.DMA_Channel = DMA_Channel_4; DMA_InitStruct.DMA_PeripheralBaseAddr = (uint32_t)&USART1->DR; DMA_InitStruct.DMA_Memory0BaseAddr = (uint32_t)buffer_a; DMA_InitStruct.DMA_DIR = DMA_DIR_PeripheralToMemory; DMA_InitStruct.DMA_BufferSize = BUFFER_SIZE; DMA_InitStruct.DMA_PeripheralInc = DMA_PeripheralInc_Disable; DMA_InitStruct.DMA_MemoryInc = DMA_MemoryInc_Enable; DMA_InitStruct.DMA_PeripheralDataSize = DMA_PeripheralDataSize_Byte; DMA_InitStruct.DMA_MemoryDataSize = DMA_MemoryDataSize_Byte; DMA_InitStruct.DMA_Mode = DMA_Mode_Circular; DMA_InitStruct.DMA_Priority = DMA_Priority_High; DMA_InitStruct.DMA_FIFOMode = DMA_FIFOMode_Disable; DMA_InitStruct.DMA_MemoryBurst = DMA_MemoryBurst_Single; DMA_InitStruct.DMA_PeripheralBurst = DMA_PeripheralBurst_Single; DMA_Init(DMA2_Stream2, &DMA_InitStruct); // 双缓冲配置 DMA_DoubleBufferModeConfig(DMA2_Stream2, (uint32_t)buffer_b, DMA_Memory_1); DMA_DoubleBufferModeCmd(DMA2_Stream2, ENABLE); // 中断配置 DMA_ITConfig(DMA2_Stream2, DMA_IT_TC, ENABLE); NVIC_InitTypeDef NVIC_InitStruct; NVIC_InitStruct.NVIC_IRQChannel = DMA2_Stream2_IRQn; NVIC_InitStruct.NVIC_IRQChannelPreemptionPriority = 0; NVIC_InitStruct.NVIC_IRQChannelSubPriority = 0; NVIC_InitStruct.NVIC_IRQChannelCmd = ENABLE; NVIC_Init(&NVIC_InitStruct); // 使能 DMA 和 USART DMA_Cmd(DMA2_Stream2, ENABLE); USART_DMACmd(USART1, USART_DMAReq_RX, ENABLE); USART_Cmd(USART1, ENABLE); } void DMA2_Stream2_IRQHandler(void) { if (DMA_GetITStatus(DMA2_Stream2, DMA_IT_TC)) { DMA_ClearITPendingBit(DMA2_Stream2, DMA_IT_TC); // 获取当前 DMA 使用的缓冲区(另一块是 CPU 可用的) uint32_t current_target = DMA_GetCurrentMemoryTarget(DMA2_Stream2); current_buf = (current_target == DMA_Memory_0) ? buffer_b : buffer_a; // Invalidate Cache,确保读取最新数据 SCB_InvalidateDCache_by_Addr((uint32_t*)current_buf, BUFFER_SIZE); data_ready = 1; // 通知主循环处理 } } int main(void) { // 系统初始化(时钟、GPIO等) SystemInit(); SCB_EnableDCache(); // 使能 D-Cache(假设外部 SDRAM 已初始化) UART_DMA_Init(); while (1) { if (data_ready) { data_ready = 0; // 处理 current_buf 中的数据 ProcessData(current_buf, BUFFER_SIZE); // 如果修改了数据,需要 Clean 后再允许 DMA 使用 // SCB_CleanDCache_by_Addr((uint32_t*)current_buf, BUFFER_SIZE); } } } ``` # 4. 注意事项与最佳实践 - **缓冲区对齐**:务必按 Cache Line 大小(STM32F4 为 32 字节)对齐,避免伪共享。可使用 `__attribute__((aligned(32)))` 或 CMSIS 的 `ALIGN_32BYTES`。 - **Cache 操作范围**:`SCB_InvalidateDCache_by_Addr` 和 `SCB_CleanDCache_by_Addr` 的地址必须 32 字节对齐,长度最好为 32 的倍数,否则需手动处理首尾未对齐部分。 - **操作顺序**:在 DMA 写入前,若 CPU 修改过缓冲区,必须 Clean;在 DMA 写入后,CPU 读取前,必须 Invalidate。顺序不可颠倒。 - **中断优先级**:DMA 中断优先级应高于可能访问缓冲区的其他中断,避免竞态。 - **性能考量**:频繁的 Cache 操作会降低性能,可考虑将 DMA 缓冲区放在 Non-cacheable 区域(如使用 MPU 配置),但需权衡访问速度。 - **调试技巧**:使用逻辑分析仪或断点观察缓冲区内容,确认数据一致性。 # 结语 STM32F4 的 DMA 双缓冲设计在启用 Cache 时,必须将一致性维护作为核心环节。通过理解 Cache 与 DMA 的交互机制,遵循对齐、Clean/Invalidate 的正确顺序,并妥善处理切换竞态,可以彻底规避数据错乱和性能陷阱。希望本文的剖析与代码示例能帮助你在实际项目中构建稳定高效的 DMA 系统。