44、MPI编程基础与点对点通信详解

MPI编程基础与点对点通信详解

1. MPI基础概述

MPI(Message Passing Interface)程序基于SPMD(Single Program, Multiple Data)并行执行模型,所有MPI进程执行相同的程序。MPI系统提供了一组API函数来建立通信系统,使进程间能够相互通信。以下是建立和关闭通信系统的五个基本MPI函数:
| 函数 | 功能 |
| ---- | ---- |
| int MPI_Init (int*argc, char***argv) | 初始化MPI |
| int MPI_Comm_rank (MPI_Comm comm, int *rank) | 获取调用进程在通信器中的排名 |
| int MPI_Comm_size (MPI_Comm comm, int *size) | 获取通信器中的进程数量 |
| int MPI_Comm_abort (MPI_Comm comm) | 终止MPI通信连接并设置错误标志 |
| int MPI_Finalize ( ) | 结束MPI应用程序,关闭所有资源 |

要在集群中启动MPI应用程序,用户需要将程序的可执行文件提供给 mpirun mpiexec 命令。

2. 简单MPI程序示例

以下是一个简单的MPI主程序示例:

#include "mpi.h“
int main(int argc, char *argv[]) {
    int pad = 0, dimx = 480+pad, dimy = 480, dimz = 400, nreps = 100;
    int pid=-1, np=-1;
    MPI_Init(&argc, &argv);
    MPI_Comm_rank(MPI_COMM_WORLD, &pid);
    MPI_Comm_size(MPI_COMM_WORLD, &np);
    if(np < 3) {
        if(0 == pid) printf(“Needed 3 or more processes.\n");
        MPI_Abort( MPI_COMM_WORLD, 1 ); return 1;
    }
    if(pid < np - 1)
        compute_process(dimx, dimy, dimz/ (np - 1), nreps);
    else
        data_server( dimx,dimy,dimz, nreps);
    MPI_Finalize();
    return 0;
}

该程序的执行步骤如下:
1. 调用 MPI_Init 初始化MPI运行时。
2. 调用 MPI_Comm_rank 获取当前进程的唯一ID(即排名)。
3. 调用 MPI_Comm_size 获取运行的MPI进程总数。
4. 检查进程数量是否至少为3,如果不足则调用 MPI_Comm_abort 终止通信连接并返回错误标志。
5. 根据进程ID,调用 compute_process data_server 函数进行计算或数据服务。
6. 调用 MPI_Finalize 结束MPI应用程序,释放所有通信资源。

3. MPI点对点通信

MPI支持两种主要的通信类型,其中之一是点对点通信,涉及一个源进程和一个目标进程。源进程调用 MPI_Send 函数,目标进程调用 MPI_Recv 函数。

3.1 MPI_Send 函数
int MPI_Send (void *buf, int count, 
              MPI_Datatype datatype, int dest, int tag, 
              MPI_Comm comm)

参数说明:
- buf :发送缓冲区的起始地址(指针)
- count :发送缓冲区中的元素数量(非负整数)
- datatype :发送缓冲区中每个元素的数据类型(MPI_Datatype)
- dest :目标进程的排名(整数)
- tag :消息标签(整数)
- comm :通信器(句柄)

3.2 MPI_Recv 函数
int MPI_Recv (void *buf, int count,
              MPI_Datatype datatype, int source, int tag, 
              MPI_Comm comm, MPI_Status *status)

参数说明:
- buf :接收缓冲区的起始地址(指针)
- count :接收缓冲区中允许接收的最大元素数量(整数)
- datatype :接收缓冲区中每个元素的数据类型(MPI_Datatype)
- source :源进程的排名(整数)
- tag :消息标签(整数)
- comm :通信器(句柄)
- status :状态对象(Status)

4. 数据服务器代码分析

以下是数据服务器代码的第一部分:

void data_server(int dimx, int dimy, int dimz, int nreps) {
    int np;
    MPI_Comm_size(MPI_COMM_WORLD, &np);
    int num_comp_nodes = np – 1, first_node = 0, last_node = np - 2;
    unsigned int num_points = dimx * dimy * dimz;
    unsigned int num_bytes  = num_points * sizeof(float);
    float *input=0, *output=0;
    input = (float *)malloc(num_bytes);
    output = (float *)malloc(num_bytes);
    if(input == NULL || output == NULL) {
        printf("server couldn't allocate memory\n");
        MPI_Abort( MPI_COMM_WORLD, 1 );
    }
    random_data(input, dimx, dimy ,dimz , 1, 10);
    int edge_num_points = dimx * dimy * ((dimz / num_comp_nodes) + 4);
    int int_num_points  = dimx * dimy * ((dimz / num_comp_nodes) + 8);
    float *send_address = input;
}

该部分代码的执行步骤如下:
1. 调用 MPI_Comm_size 获取运行的MPI进程总数。
2. 计算计算进程的数量、第一个和最后一个计算进程的ID。
3. 计算网格数据点的总数和所需的字节数。
4. 分配输入和输出缓冲区的内存。
5. 检查内存分配是否成功,如果失败则终止应用程序并报告错误。
6. 用随机数初始化输入数据。
7. 计算需要发送给边缘进程和内部进程的网格点数量。
8. 设置发送地址指针指向输入网格点数组的开头。

以下是数据服务器代码的第二部分:

/* Send data to the first compute node */
MPI_Send(send_address, edge_num_points, MPI_FLOAT, first_node, 0, MPI_COMM_WORLD );
send_address += dimx * dimy * ((dimz / num_comp_nodes) - 4);
/* Send data to "internal" compute nodes */
for(int process = 1; process < last_node; process++) {
    MPI_Send(send_address, int_num_points, MPI_FLOAT, process, 0, MPI_COMM_WORLD);
    send_address += dimx * dimy * (dimz / num_comp_nodes);
}
/* Send data to the last compute node */
MPI_Send(send_address, edge_num_points, MPI_FLOAT, last_node, 0, MPI_COMM_WORLD);

该部分代码的执行步骤如下:
1. 发送数据给第一个计算进程(边缘进程)。
2. 调整发送地址指针,准备发送数据给下一个进程。
3. 使用循环发送数据给内部进程。
4. 发送数据给最后一个计算进程(边缘进程)。

5. 计算进程代码分析

以下是计算进程代码的第一部分:

void compute_node_stencil(int dimx, int dimy, int dimz, int nreps ) 
{
    int np, pid;
    MPI_Comm_rank(MPI_COMM_WORLD, &pid);
    MPI_Comm_size(MPI_COMM_WORLD, &np);
    int server_process = np - 1;
    unsigned int num_points       = dimx * dimy * (dimz + 8);
    unsigned int num_bytes        = num_points * sizeof(float);
    unsigned int num_halo_points = 4 * dimx * dimy;
    unsigned int num_halo_bytes  = num_halo_points * sizeof(float);
    /* Alloc host memory */
    float *h_input  = (float *)malloc(num_bytes);
    /* Alloc device memory for input and output data */
    float *d_input = NULL;
    cudaMalloc((void **)&d_input,  num_bytes );
    float *rcv_address = h_input + num_halo_points * (0 == pid);
    MPI_Recv(rcv_address, num_points, MPI_FLOAT, server_process, MPI_ANY_TAG, MPI_COMM_WORLD, &status );
}

该部分代码的执行步骤如下:
1. 获取当前进程的ID和运行的MPI进程总数。
2. 确定数据服务器的进程ID。
3. 计算需要处理的网格点数量和字节数,以及每个光晕(四个切片)的网格点数量和字节数。
4. 分配主机内存和设备内存用于输入数据。
5. 设置接收数据的起始地址,根据进程ID调整地址。
6. 从数据服务器接收MPI消息。

以下是计算进程代码的第二部分(待补充完整):

// 此处为代码第二部分内容,原文未完整给出
6. 流程图
graph TD;
    A[MPI应用程序启动] --> B[MPI_Init初始化];
    B --> C[MPI_Comm_rank获取进程ID];
    C --> D[MPI_Comm_size获取进程总数];
    D --> E{进程数量是否至少为3};
    E -- 是 --> F{进程ID < np - 1};
    E -- 否 --> G[MPI_Comm_abort终止通信];
    F -- 是 --> H[compute_process计算];
    F -- 否 --> I[data_server数据服务];
    H --> J[MPI_Finalize结束应用];
    I --> J;
    G --> K[返回错误标志];
    J --> L[返回0表示无错误];

以上内容详细介绍了MPI的基础概念、基本函数的使用、点对点通信的实现,以及数据服务器和计算进程的代码分析。通过这些内容,读者可以更好地理解MPI编程的基本原理和实现方法。

MPI编程基础与点对点通信详解(续)

7. 数据接收与内存处理细节

在计算进程代码的第一部分中,对于数据接收和内存处理有一些关键细节需要进一步说明。

当使用 MPI_Recv 接收数据时,虽然所有计算进程都设置接收 num_points 个数据点,但数据服务器实际发送给不同进程的数据量是不同的。对于进程 0,它只接收到分区和右侧的光晕数据;对于进程 np - 2 ,它接收到左侧的光晕数据和分区。

在内存分配方面,为了简化处理,所有进程都分配了相同大小的内存,即使边缘进程(进程 0 和进程 np - 2 )实际使用的内存小于分配的内存。这种做法虽然会造成一定的内存浪费,但可以避免复杂的内存管理逻辑。

以下是一个表格总结不同进程的数据接收情况:
| 进程 ID | 接收数据内容 | 内存使用情况 |
| ---- | ---- | ---- |
| 0 | 分区 + 右侧光晕 | 跳过前四个切片使用内存 |
| 1 到 np - 3 | 分区 + 左右两侧光晕 | 完整使用分配内存 |
| np - 2 | 左侧光晕 + 分区 | 最后四个切片内存未使用 |

8. 数据处理与计算逻辑

在计算进程接收到数据后,接下来就是进行具体的计算。虽然原文未给出完整的计算代码,但我们可以推测其大致的计算逻辑。

通常,计算进程会在设备内存中对数据进行处理,可能会使用一些迭代算法,如 Jacobi 迭代法。在每次迭代中,每个网格点的计算需要其相邻网格点的值。由于我们在数据分配时已经考虑了光晕数据,因此可以满足这种计算需求。

以下是一个简单的伪代码示例,展示可能的计算逻辑:

for (int rep = 0; rep < nreps; rep++) {
    for (int z = 0; z < dimz; z++) {
        for (int y = 0; y < dimy; y++) {
            for (int x = 0; x < dimx; x++) {
                // 根据相邻网格点的值计算当前网格点的新值
                // 这里需要考虑光晕数据
                new_value = calculate_new_value(x, y, z);
                // 更新设备内存中的值
                update_device_memory(x, y, z, new_value);
            }
        }
    }
}
9. 数据服务器收集输出值

前面提到数据服务器代码还未完成,接下来我们分析数据服务器如何收集计算进程的输出值。

数据服务器在发送完数据给计算进程后,需要等待计算进程完成计算,并接收它们的输出值。这可以通过在数据服务器代码中添加接收逻辑来实现。

以下是一个可能的数据服务器收集输出值的代码示例:

// 继续数据服务器代码
for (int process = 0; process < last_node; process++) {
    MPI_Recv(output + process * dimx * dimy * (dimz / num_comp_nodes), 
             dimx * dimy * (dimz / num_comp_nodes), 
             MPI_FLOAT, 
             process, 
             0, 
             MPI_COMM_WORLD, 
             &status);
}

该代码使用一个循环,依次接收每个计算进程的输出值,并将其存储在输出缓冲区中。

10. 完整代码示例总结

为了方便读者理解,以下是一个完整的 MPI 程序示例,包含数据服务器和计算进程的代码:

#include "mpi.h"
#include <stdio.h>
#include <stdlib.h>

// 模拟随机数据初始化函数
void random_data(float *input, int dimx, int dimy, int dimz, int min, int max) {
    for (int z = 0; z < dimz; z++) {
        for (int y = 0; y < dimy; y++) {
            for (int x = 0; x < dimx; x++) {
                input[z * dimx * dimy + y * dimx + x] = (float)(rand() % (max - min + 1) + min);
            }
        }
    }
}

// 模拟计算函数
void compute_process(int dimx, int dimy, int dimz, int nreps) {
    int np, pid;
    MPI_Comm_rank(MPI_COMM_WORLD, &pid);
    MPI_Comm_size(MPI_COMM_WORLD, &np);
    int server_process = np - 1;
    unsigned int num_points = dimx * dimy * (dimz + 8);
    unsigned int num_bytes = num_points * sizeof(float);
    unsigned int num_halo_points = 4 * dimx * dimy;
    unsigned int num_halo_bytes = num_halo_points * sizeof(float);
    float *h_input = (float *)malloc(num_bytes);
    float *d_input = NULL;
    cudaMalloc((void **)&d_input, num_bytes);
    float *rcv_address = h_input + num_halo_points * (0 == pid);
    MPI_Status status;
    MPI_Recv(rcv_address, num_points, MPI_FLOAT, server_process, MPI_ANY_TAG, MPI_COMM_WORLD, &status);
    // 这里可以添加具体的计算逻辑
    // 模拟计算
    for (int i = 0; i < nreps; i++) {
        // 简单的计算示例
        for (int j = 0; j < num_points; j++) {
            d_input[j] = d_input[j] * 2;
        }
    }
    // 发送计算结果给数据服务器
    MPI_Send(d_input, dimx * dimy * dimz, MPI_FLOAT, server_process, 0, MPI_COMM_WORLD);
    cudaFree(d_input);
    free(h_input);
}

// 数据服务器函数
void data_server(int dimx, int dimy, int dimz, int nreps) {
    int np;
    MPI_Comm_size(MPI_COMM_WORLD, &np);
    int num_comp_nodes = np - 1, first_node = 0, last_node = np - 2;
    unsigned int num_points = dimx * dimy * dimz;
    unsigned int num_bytes = num_points * sizeof(float);
    float *input = (float *)malloc(num_bytes);
    float *output = (float *)malloc(num_bytes);
    if (input == NULL || output == NULL) {
        printf("server couldn't allocate memory\n");
        MPI_Abort(MPI_COMM_WORLD, 1);
    }
    random_data(input, dimx, dimy, dimz, 1, 10);
    int edge_num_points = dimx * dimy * ((dimz / num_comp_nodes) + 4);
    int int_num_points = dimx * dimy * ((dimz / num_comp_nodes) + 8);
    float *send_address = input;
    // 发送数据给第一个计算节点
    MPI_Send(send_address, edge_num_points, MPI_FLOAT, first_node, 0, MPI_COMM_WORLD);
    send_address += dimx * dimy * ((dimz / num_comp_nodes) - 4);
    // 发送数据给内部计算节点
    for (int process = 1; process < last_node; process++) {
        MPI_Send(send_address, int_num_points, MPI_FLOAT, process, 0, MPI_COMM_WORLD);
        send_address += dimx * dimy * (dimz / num_comp_nodes);
    }
    // 发送数据给最后一个计算节点
    MPI_Send(send_address, edge_num_points, MPI_FLOAT, last_node, 0, MPI_COMM_WORLD);
    // 接收计算结果
    for (int process = 0; process < last_node; process++) {
        MPI_Recv(output + process * dimx * dimy * (dimz / num_comp_nodes), 
                 dimx * dimy * (dimz / num_comp_nodes), 
                 MPI_FLOAT, 
                 process, 
                 0, 
                 MPI_COMM_WORLD, 
                 &status);
    }
    free(input);
    free(output);
}

int main(int argc, char *argv[]) {
    int pad = 0, dimx = 480 + pad, dimy = 480, dimz = 400, nreps = 100;
    int pid = -1, np = -1;
    MPI_Init(&argc, &argv);
    MPI_Comm_rank(MPI_COMM_WORLD, &pid);
    MPI_Comm_size(MPI_COMM_WORLD, &np);
    if (np < 3) {
        if (0 == pid) printf("Needed 3 or more processes.\n");
        MPI_Abort(MPI_COMM_WORLD, 1);
        return 1;
    }
    if (pid < np - 1)
        compute_process(dimx, dimy, dimz / (np - 1), nreps);
    else
        data_server(dimx, dimy, dimz, nreps);
    MPI_Finalize();
    return 0;
}
11. 错误处理与资源管理

在 MPI 编程中,错误处理和资源管理非常重要。在上述代码中,我们可以看到一些错误处理的示例,如内存分配失败时调用 MPI_Abort 终止通信。

在资源管理方面,需要确保在程序结束时释放所有分配的内存和设备资源。例如,在计算进程中使用 cudaFree 释放设备内存,使用 free 释放主机内存;在数据服务器中同样需要释放输入和输出缓冲区的内存。

以下是一个简单的流程图,展示了错误处理和资源管理的流程:

graph TD;
    A[程序开始] --> B[分配资源];
    B --> C{资源分配是否成功};
    C -- 是 --> D[执行计算或通信];
    C -- 否 --> E[错误处理];
    D --> F{计算或通信是否成功};
    F -- 是 --> G[释放资源];
    F -- 否 --> E;
    E --> H[终止程序并返回错误];
    G --> I[程序正常结束];
12. 总结

通过本文的介绍,我们深入了解了 MPI 编程的基础知识,包括 MPI 的基本函数使用、点对点通信的实现、数据服务器和计算进程的代码编写,以及错误处理和资源管理等方面。

MPI 作为一种强大的并行编程模型,在高性能计算领域有着广泛的应用。通过合理地使用 MPI 函数和优化代码逻辑,可以充分发挥集群计算的优势,提高程序的性能和效率。

希望读者通过本文的学习,能够掌握 MPI 编程的基本技巧,并在实际项目中灵活运用。

内容概要:本文系统性地介绍了Neo4j图数据库的技术体系、核心原理企业级实战应用,涵盖从基础理论到生产落地的完整知识链条。深入剖析了Neo4j作为原生图数据库在存储架构、数据模型、查询语言(Cypher)方面的核心技术优势,重点讲解其基于节点、关系、属性的三元组模型和原生图存储机制,对比传统关系型数据库在处理复杂关联数据时的性能瓶颈。文档全面覆盖环境部署、工业级建模规范、Cypher深度编程、海量数据导入、Python/Java全栈开发集成、图算法分析(GDS)、高可用集群搭建及性能调优等内容,并通过金融风控知识图谱项目实现端到端的综合实战演练,提供可直接复用的建模模板、优化方案故障排查手册。; 适合人群:具备一定数据库基础,从事大数据、人工智能、金融风控、知识图谱等相关领域的研发人员、架构师及数据工程师,尤其适合工作1-5年希望掌握图数据库企业级开发能力的技术人员。; 使用场景及目标:①掌握Neo4j在金融风控、社交网络、知识图谱等复杂关联场景下的建模查询能力;②实现海量图数据的高效导入、集群部署性能优化;③结合GDS图算法进行社群发现、路径分析、核心节点挖掘等智能分析任务;④构建前后端一体化的企业级图谱可视化系统。; 阅读建议:此资源强调工程化生产级落地,建议结合实际项目边学边练,重点关注建模规范、索引设计、Cypher执行计划优化集群运维等关键环节,配套源码配置模板应作为开发参考标准使用。
代码下载链接: https://pan.quark.cn/s/a4b39357ea24 网站扒站工具,如标题所述,是用于复制或仿制网站内容的技术手段。 这些工具能够帮助用户抓取网站上的HTML代码、图片、CSS样式表、JavaScript文件等资源,以实现快速构建原网站相似的新站点。 在IT行业中,这种行为有时被称为网页抓取或网页克隆,对于学习、分析或测试网站设计有着重要作用。 Teleport Ultra 是一款知名的扒站工具,它允许用户以一种系统化的方式下载整个网站到本地计算机上,以便离线查看或进一步分析。 以下是对Teleport Ultra及其功能的详细介绍: 1. **全面抓取**:Teleport Ultra能深入网站的每一个角落,不仅抓取首页,还能追踪链接,将整个网站的结构、内容和资源都下载下来。 这包括静态页面、动态内容、登录后的页面等。 2. **自定义设置**:用户可以设定抓取范围,例如只抓取特定目录,或者排除某些不想要的页面。 此外,还可以设置代理服务器,以匿名方式抓取,避免被目标网站检测到。 3. **时间调度**:对于大型或需要分时段抓取的网站,Teleport Ultra支持定时任务,可以在指定的时间自动开始抓取工作。 4. **内容过滤**:该工具允许用户过滤掉不需要的元素,如广告、脚本或图片,只保留核心内容。 5. **网站镜像**:完成抓取后,Teleport Ultra可以创建一个完整的网站镜像,包括所有链接关系,使得在本地浏览时体验在线网站几乎一致。 6. **报告生成**:它还提供详细的抓取报告,包括未成功下载的页面、错误信息等,方便用户检查和修复问题。 7. **易于使用**:Teleport Ultra的界面直观,即使对编程不...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值