C语言内存视角:数据类型本质是地址与读取大小的抽象

这次我们来看一个在C语言学习与系统编程中极具颠覆性的观点: “数据类型不存在,有的仅仅是内存地址和读取的大小” 。这个观点并非来自某个具体的开源项目,而是一种深刻理解计算机底层运作的核心思想。它直接挑战了初学者对 int float char 等数据类型的传统认知,将视角从高级语言的抽象层拉回到内存和CPU指令的物理现实。

对于C/C++开发者、嵌入式工程师或任何希望深入理解程序如何在计算机中运行的人来说,掌握这一视角至关重要。它能帮你彻底理解指针、内存对齐、类型转换、数据序列化等复杂概念,并从根本上避免因类型误解导致的隐蔽Bug。本文不会教你如何声明一个变量,而是带你穿透“类型”这层语法糖,直接看到内存的本质,并通过大量代码实验来验证这一观点。

我们将从内存地址和字节读取的角度,重新审视以下核心问题:

  1. 变量究竟是什么? 它只是一个被命名和赋予了“类型解释”的内存区域。
  2. 类型转换的底层发生了什么? 仅仅是改变了对同一块内存数据的“解读规则”。
  3. 指针为何强大? 因为它直接操作内存地址,可以绕过编译器对类型的严格检查。
  4. 如何验证这一观点? 通过联合体(union)、指针强制转换、内存直接读写等操作。

如果你曾对指针感到困惑,对 (int*) (void*) 等强制转换心存疑虑,或想写出更高效、更贴近硬件的代码,那么这篇文章正是为你准备的。我们将用C语言代码作为“显微镜”,直接观察内存中的比特位是如何被不同“解读方式”处理的。

1. 核心观点速览

在深入细节之前,我们先通过一个表格快速把握这个核心观点的全貌及其影响。

维度 传统视角(语法层面) 本文视角(内存/机器层面) 关键启示
变量定义 声明一个特定类型的变量,如 int a = 10; 向操作系统申请一块连续内存(如4字节),并给这块内存起始地址贴上一个叫 a 的标签,同时约定用 int 规则解读它。 变量名是地址的别名,类型是读写的“说明书”。
数据类型 具有特定含义(整型、浮点、字符)和固定大小的数据分类。 不存在于运行时内存中。它只是编译器在编译时用于 生成不同机器指令 (如 mov 整数指令 vs fld 浮点指令)和 检查语法 的一套规则。 “类型”是编译期的概念,用于指导生成正确的代码。内存里只有比特位。
赋值操作 将值 10 赋给整型变量 a 将比特模式 0x0000000A 写入标签 a 所代表的内存地址开始的4个字节。 a = 10 的本质是内存写入操作。
指针 存放另一个变量地址的变量,有类型(如 int* )。 一个存储内存地址的变量。其“类型”告诉编译器:“当我解引用时,请按照 int 的规则去读写那个地址开始的数据”。 指针的类型决定了 解引用操作 的宽度和解释方式,而非地址值本身。
强制类型转换 将一种类型转换为另一种类型。 告诉编译器:“请暂时忘记原来的类型解读规则,用新的规则去处理这块内存地址的数据”。数据本身的比特位未发生任何改变。 转换的是“视角”,而非数据内容。这是理解许多底层技巧的关键。
内存内容 存储着“整数10”、“字符‘A’”。 只有连续的字节序列,例如 0x41 0x00 0x00 0x00 。这个序列可以被解释为整数 65 、ASCII字符 'A' 或浮点数 9.10844e-44 (取决于解读方式)。 数据本身没有意义,意义来自于我们如何解释它。

这个视角将C语言从一门高级语言,还原为一种“可移植的汇编语言”,它赋予开发者直接操纵内存的能力,同时也要求开发者对底层负责。

2. 为什么需要理解“数据类型不存在”?

理解“数据类型仅是内存地址和读取大小的抽象”这一观点,并非为了标新立异,而是有实实在在的工程价值。

对学习者而言:

  • 根治指针恐惧症 :指针的本质就是一个内存地址。类型 int* char* 只是附加在这个地址上的“操作指南”。理解了这一点,指针运算、多级指针、函数指针都将变得直观。
  • 看透类型转换 :明白 (float)a (int*)p 底层并未改变数据,只是改变了编译器生成的指令,能避免许多逻辑错误。
  • 理解内存布局 :为后续学习结构体对齐、字节序(大小端)、内存映射I/O、网络字节序转换打下坚实基础。

对开发者而言:

  • 实现高级内存操作 :如实现通用内存拷贝( memcpy )、动态类型存储、序列化/反序列化(将结构体直接写入文件或网络)等。
  • 进行底层系统编程 :在操作系统、驱动开发、嵌入式系统中,经常需要直接读写特定物理地址,或将一块内存“解释”为不同的数据结构。
  • 调试与性能分析 :当程序出现内存错误(如段错误、数据损坏)时,能够从内存比特位的层面分析原因,而不是停留在变量名的层面。
  • 编写高效代码 :理解对齐访问、缓存友好型数据结构设计,都离不开对内存布局的深刻认识。

简而言之,放弃“数据类型是神圣不可侵犯的”这一观念,是成为高级C程序员的必经之路。

3. 环境准备:你的“内存观察实验室”

要验证和实验本文的观点,你只需要一个能运行C语言的开发环境。我们将在其中编写代码,像做实验一样观察内存。

基础环境要求:

  • 操作系统 :Windows (MinGW/WSL)、Linux 或 macOS。
  • 编译器 :GCC 或 Clang。本文示例使用GCC。
  • 开发工具 :任意文本编辑器(VS Code, Vim等)或IDE(CLion, Visual Studio等)。
  • 调试器(推荐) :GDB (Linux/macOS/WSL) 或对应IDE的调试器。调试器可以让我们单步执行并实时查看内存内容,是最佳的学习工具。

验证环境是否就绪: 打开终端(或命令提示符),创建一个测试文件 test_memory.c ,并尝试编译运行。

# 1. 创建测试文件
echo '#include <stdio.h>
int main() {
    int a = 0x12345678;
    unsigned char *p = (unsigned char*)&a;
    for(int i=0; i<sizeof(a); i++) {
        printf("Byte %d: 0x%02X\n", i, p[i]);
    }
    return 0;
}' > test_memory.c

# 2. 编译
gcc -o test_memory test_memory.c

# 3. 运行
./test_memory

如果运行后能看到类似以下的输出(字节顺序可能不同),说明你的环境已准备好进行后续的所有内存实验。

Byte 0: 0x78
Byte 1: 0x56
Byte 2: 0x34
Byte 3: 0x12

这个简单的程序已经揭示了核心观点:我们将一个 int 类型变量 a 的地址,强制转换为 unsigned char* (即按字节解读的指针),然后逐个字节打印其内存内容。 我们正在绕过 int 的类型限制,直接检视内存!

4. 从零验证:内存地址与读取大小

让我们通过几个渐进式的实验,彻底理解“数据类型是内存地址+读取大小”这一本质。

4.1 实验一:变量只是带标签的内存区域

#include <stdio.h>

int main() {
    int num = 999; // 传统视角:定义了一个整型变量num,值为999
    // 内存视角:在栈上分配了4个字节,地址为&num,存储了比特位 0x000003E7

    printf("变量名: num\n");
    printf("值: %d\n", num);
    printf("内存地址: %p\n", (void*)&num); // 关键:获取这块内存的地址
    printf("占用内存大小: %zu 字节\n", sizeof(num)); // 关键:获取解读它需要多少字节

    // 我们甚至可以直接用地址来修改它,绕过变量名
    int *p_num = &num;
    *p_num = 111;
    printf("通过指针修改后,num的值: %d\n", num); // 输出 111

    return 0;
}

运行与思考: 这个程序展示了 num 这个“变量”的三要素: 值(999/111)、地址(&num)、大小(sizeof(num)) p_num = &num 这个操作,就是把这块内存的地址存到另一个变量(指针)里。修改 *p_num 就是直接修改地址 &num 处的内存内容。变量名 num 在编译后很可能就不存在了(被优化为地址),它只是给程序员看的标签。

4.2 实验二:同一内存,不同解读(联合体Union)

联合体 union 是C语言中展示“内存视角”最直接的工具。它允许多个成员共享同一块内存。

#include <stdio.h>
#include <stdint.h> // 用于精确宽度整数类型

union Data {
    uint32_t i;        // 4字节无符号整数
    float f;           // 4字节单精度浮点数
    unsigned char bytes[4]; // 4个独立的字节
};

int main() {
    union Data data;

    // 操作1:以整数形式写入
    data.i = 0x40490FDB; // 这个十六进制数是浮点数 3.14159265 的 IEEE 754 内存表示
    printf("写入整数: 0x%08X (%u)\n", data.i, data.i);
    printf("以浮点数解读: %f\n", data.f); // 关键输出!
    printf("字节序列: ");
    for(int i=0; i<4; i++) {
        printf("0x%02X ", data.bytes[i]);
    }
    printf("\n\n");

    // 操作2:以浮点数形式写入
    data.f = 100.5;
    printf("写入浮点数: %f\n", data.f);
    printf("以整数解读: 0x%08X (%u)\n", data.i, data.i); // 关键输出!
    printf("字节序列: ");
    for(int i=0; i<4; i++) {
        printf("0x%02X ", data.bytes[i]);
    }
    printf("\n");

    return 0;
}

运行结果分析: 你会看到,当我们以整数形式 data.i 写入 0x40490FDB 后,用 data.f 读出来的结果大约是 3.141593 。反之,写入浮点数 100.5 后,用 data.i 读出来是一个很大的整数(如 1120403456 )。

核心结论: 内存( union Data 所占的4个字节)里的比特位没有变,变的是我们访问它时使用的“钥匙”(成员类型)。 i f bytes 这三把“钥匙”指向的是同一块内存区域,只是解码规则不同。这完美证明了“类型”是附属于访问操作的一种解读方式,而非内存数据固有的属性。

4.3 实验三:指针强制转换——临时的“类型面具”

指针强制转换是更灵活、也更危险的“类型视角切换”操作。它允许我们将指向一种类型的指针,临时当作另一种类型的指针来使用。

#include <stdio.h>

int main() {
    float pi = 3.14159265f;

    printf("浮点数 pi 的值: %.6f\n", pi);
    printf("pi 的内存地址: %p\n", (void*)&pi);

    // 关键步骤:将 float* 强制转换为 int*
    // 这相当于说:“嘿,编译器,请把 &pi 这个地址开始的数据,暂时当成 int 类型来处理”
    unsigned int *int_ptr = (unsigned int*)&pi;

    printf("将 float* 强制转换为 unsigned int* 后...\n");
    printf("通过 int_ptr 读取的值(十六进制): 0x%08X\n", *int_ptr);
    printf("通过 int_ptr 读取的值(十进制): %u\n", *int_ptr);

    // 我们还可以通过 int_ptr 修改内存,从而影响 pi
    *int_ptr = 0x40000000; // 这个十六进制对应浮点数 2.0
    printf("通过 int_ptr 写入 0x40000000 后...\n");
    printf("现在 pi 的值(作为浮点数): %f\n", pi); // 输出应为 2.000000

    return 0;
}

运行与理解:

  1. float pi 在内存中按照IEEE 754格式存储了 3.14159265 的二进制表示。
  2. (unsigned int*)&pi 创建了一个新的“视角”。 int_ptr 存储的地址和 &pi 完全相同,但它宣称“我指向的是一个 unsigned int ”。
  3. 当解引用 *int_ptr 时,编译器生成读取4字节内存的指令,并 将这些比特位按照无符号整数的规则进行解释 ,于是我们得到了一个看似无意义的巨大整数。
  4. 当我们通过 *int_ptr = 0x40000000 写入时,编译器生成写入4字节的指令,将比特位 0x40000000 直接塞进 pi 的内存中。
  5. 最后,当我们再次以 float 视角( pi )读取时,内存中的 0x40000000 被解释为浮点数 2.0

警告: 指针强制转换需要非常小心,必须确保转换后的类型访问不会越界(例如用 int* 去读一个 char 变量),并且要理解不同数据类型的二进制格式差异(如整数补码 vs 浮点数IEEE 754)。滥用会导致未定义行为(Undefined Behavior)。

5. 深入探索:内存布局与操作

理解了基本观点后,我们可以探索更复杂的场景,看看这一视角如何解释实际编程中的现象。

5.1 结构体(struct)的内存布局

结构体是多个变量的集合,它在内存中依然是连续的字节块。

#include <stdio.h>
#include <stddef.h> // 用于 offsetof 宏

struct Person {
    char name[20]; // 20字节
    int age;       // 4字节
    float height;  // 4字节
};

int main() {
    struct Person p = {"Alice", 30, 1.65f};
    printf("结构体 Person 总大小: %zu 字节\n", sizeof(struct Person));
    printf("成员 name 的偏移量: %zu 字节\n", offsetof(struct Person, name));
    printf("成员 age 的偏移量: %zu 字节\n", offsetof(struct Person, age));
    printf("成员 height 的偏移量: %zu 字节\n", offsetof(struct Person, height));

    // 将整个结构体视为一个字节数组查看
    unsigned char *byte_view = (unsigned char*)&p;
    printf("\n结构体内存字节dump (前32字节):\n");
    for(size_t i = 0; i < sizeof(struct Person) && i < 32; i++) {
        printf("%02X ", byte_view[i]);
        if((i+1) % 16 == 0) printf("\n");
    }
    printf("\n");

    // 直接通过地址计算访问成员(不推荐,但可以理解原理)
    int *age_ptr = (int*)(byte_view + offsetof(struct Person, age));
    printf("通过计算出的地址直接访问 age: %d\n", *age_ptr);

    return 0;
}

关键点:

  • sizeof(struct Person) 很可能大于 20+4+4=28 字节,因为编译器可能会在成员之间插入“填充字节”(Padding)以满足内存对齐要求,提高CPU访问效率。这再次证明,我们操作的是有物理布局的内存块,而非理想化的数据集合。
  • offsetof 宏计算出每个成员变量相对于结构体起始地址的字节偏移量。访问 p.age 在底层等价于 *(int*)((char*)&p + offset_of_age)
  • 将结构体指针强制转换为 unsigned char* ,我们可以像检查原始内存一样检查它的每一个字节。

5.2 数组的本质:连续内存块的统一解读

数组是“内存视角”的另一个绝佳例子。

#include <stdio.h>

int main() {
    int arr[5] = {10, 20, 30, 40, 50};

    printf("数组名 arr 的值(地址): %p\n", (void*)arr);
    printf("&arr[0] 的地址: %p\n", (void*)&arr[0]);
    // 上面两行输出相同,证明数组名就是首元素地址

    // 指针运算:arr + i 等价于 &arr[0] + i,地址实际增加 i * sizeof(int)
    for(int i = 0; i < 5; i++) {
        printf("arr[%d] = %d, 地址: %p\n", i, arr[i], (void*)&arr[i]);
        printf("*(arr + %d) = %d (指针运算访问)\n", i, *(arr + i));
    }

    // 越界访问的危险:访问 arr[5],这超出了申请的内存范围
    // 以下代码仅用于演示概念,实际编程中严禁这样做!
    printf("\n(危险演示) arr[5] (越界) 地址: %p\n", (void*)&arr[5]);
    // 这个地址可能属于其他变量或不可访问区域,访问它会导致未定义行为。

    return 0;
}

核心理解:

  • 数组变量 arr 本质上是一个 指向一段连续内存起始地址的常量指针 ,其类型为 int* (指向 int 的指针)。
  • arr[i] 这个语法糖,在编译时会被转换为 *(arr + i) arr + i 的计算是 首地址 + i * sizeof(int) 。编译器根据数组元素的类型(这里是 int )自动计算步长。
  • 因此,对数组的访问完全建立在“基地址+偏移量”的内存模型之上。数组的类型仅仅规定了每个元素的大小和解读方式。

6. 实战应用:绕过类型系统的内存操作

理解了理论,我们来看几个有实际用途的“内存视角”编程技巧。

6.1 泛型函数模拟:memcpy 与 qsort

C标准库中的 memcpy qsort 是“无类型”内存操作的典范。

  • void *memcpy(void *dest, const void *src, size_t n);
    • 它不关心 dest src 指向的是什么类型的数据。
    • 它只负责将 src 地址开始的 n 字节 ,复制到 dest 地址开始的内存中。
    • void* 是“通用指针”,表示“这里只有一个内存地址,类型未知”。在使用时需要强制转换为具体类型的指针。
#include <stdio.h>
#include <string.h>

int main() {
    int src_arr[3] = {1, 2, 3};
    int dest_arr[3];

    // 将 src_arr 内存中的内容(12字节)复制到 dest_arr
    memcpy(dest_arr, src_arr, sizeof(src_arr));

    for(int i = 0; i < 3; i++) {
        printf("dest_arr[%d] = %d\n", i, dest_arr[i]);
    }

    // 同样可以复制结构体
    struct Point {int x; int y;} a = {100, 200}, b;
    memcpy(&b, &a, sizeof(struct Point));
    printf("b.x = %d, b.y = %d\n", b.x, b.y);

    return 0;
}
  • void qsort(void *base, size_t nmemb, size_t size, int (*compar)(const void *, const void *));
    • base :数组的起始地址( void* )。
    • nmemb :数组元素个数。
    • size 每个元素的大小(字节数) 。这是关键参数! qsort 利用这个信息在内存中正确移动元素。
    • compar :比较函数,接收两个 const void* 参数,需要内部强制转换为具体类型再比较。

qsort 通过 size 参数在内存中跳跃 size 个字节来访问每个元素,实现了对任何类型数组的排序。

6.2 手动解析二进制数据(网络包、文件格式)

在处理网络协议、文件格式(如图片头、自定义二进制文件)时,我们经常需要将一块内存解释为特定的结构。

#include <stdio.h>
#include <stdint.h>
#include <arpa/inet.h> // 用于ntohl,Linux/macOS。Windows可用Winsock2.h。

// 假设我们从网络接收到一个4字节的包头,格式为:2字节命令号 + 2字节数据长度(网络字节序,大端)
void parse_packet_header(const unsigned char* raw_data) {
    // 方法1:使用指针强制转换和位移(需注意字节序)
    uint16_t cmd = (raw_data[0] << 8) | raw_data[1]; // 手动组合字节
    uint16_t len = (raw_data[2] << 8) | raw_data[3];

    printf("方法1解析 - 命令: 0x%04X, 长度: %u\n", cmd, len);

    // 方法2:将内存直接映射到一个结构体(更清晰,但需处理对齐和字节序)
    #pragma pack(push, 1) // 告诉编译器按1字节对齐,取消填充,确保内存布局精确匹配
    struct PacketHeader {
        uint16_t command;
        uint16_t length;
    };
    #pragma pack(pop)

    const struct PacketHeader *header = (const struct PacketHeader*)raw_data;
    // 网络字节序(大端)转主机字节序
    uint16_t host_cmd = ntohs(header->command);
    uint16_t host_len = ntohs(header->length);
    printf("方法2解析 - 命令: 0x%04X, 长度: %u\n", host_cmd, host_len);
}

int main() {
    // 模拟接收到的网络数据(大端序)
    unsigned char network_data[] = {0x00, 0x01, 0x00, 0x10}; // 命令0x0001,长度0x0010(16)
    parse_packet_header(network_data);
    return 0;
}

这个例子展示了如何将一块原始内存( raw_data )按照我们约定的格式进行解读。我们既可以通过字节数组手动计算,也可以直接映射到一个紧密包装的结构体。 这里没有“网络数据”这个类型,只有内存字节和我们的解读规则。

7. 常见陷阱与安全警告

强大的能力伴随着巨大的责任。直接操作内存时,极易引入严重错误。

7.1 问题排查表

问题现象 可能原因(内存视角) 排查与解决方案
段错误(Segmentation Fault) 访问了未分配(NULL指针)、已释放或无权访问的内存地址。 1. 检查指针是否在解引用前被正确初始化( int *p = NULL; )。
2. 检查指针运算是否越界(如数组访问 arr[size] )。
3. 使用调试器(GDB)在崩溃时查看回溯(backtrace)和变量地址。
数据损坏/值莫名改变 发生了“缓冲区溢出”或“指针踩内存”。一个指针写入了超出其所属内存区域的数据,覆盖了相邻变量。 1. 检查数组边界,确保循环条件正确( i < N )。
2. 检查字符串操作( strcpy , sprintf )是否确保目标缓冲区足够大。
3. 使用工具如Valgrind、AddressSanitizer检测内存错误。
类型转换后结果不符合预期 1. 未考虑字节序(大端/小端)。
2. 未考虑不同数据类型的二进制表示差异(如整数的补码 vs 浮点数的IEEE 754)。
3. 指针转换后解引用的宽度超过了原对象大小(如将 char* 转为 int* 后访问4字节)。
1. 在跨平台/网络数据传输时,明确约定并使用字节序转换函数( htonl , ntohl 等)。
2. 理解不同数据类型的底层格式,不要随意混用。
3. 确保转换后的指针访问范围合法。使用 sizeof 运算符验证大小。
结构体大小与预期不符 编译器插入了内存对齐填充(Padding),导致 sizeof(struct) 大于各成员 sizeof 之和。 1. 使用 offsetof 宏检查成员偏移。
2. 如果需要对结构体进行精确的二进制读写(如网络传输、文件存储),考虑使用编译器指令(如 #pragma pack(1) )取消填充,但需知晓可能带来的性能损失。
函数间传递指针后出错 在函数内试图修改指向局部变量的指针,或返回指向局部变量的指针。函数返回后,其栈帧被回收,该内存地址无效。 1. 需要修改指针本身时,传递指针的指针( int **p )。
2. 需要返回指针时,确保指向的是静态内存、全局内存或堆内存( malloc 分配)。

7.2 安全使用准则

  1. 初始化指针 :定义指针变量时,立即将其初始化为 NULL 或有效地址。
  2. 检查NULL :在解引用指针前,检查其是否为 NULL
  3. 明确边界 :对数组和缓冲区操作时,心中必须清楚其大小,使用安全的函数(如 snprintf 替代 sprintf strncpy 替代 strcpy )。
  4. 谨慎类型转换 :避免不必要的指针强制转换。如果必须转换,确保理解转换前后类型的尺寸和对齐要求。
  5. 理解对象生命周期 :绝不返回指向局部变量的指针或引用。确保指针在其指向的对象有效期内使用。
  6. 使用工具辅助 :善用编译器的警告选项( -Wall -Wextra -Werror )和内存检测工具(Valgrind, AddressSanitizer)。

8. 最佳实践与思维模型

将“数据类型是内存地址+读取大小”这一模型融入日常编程,可以遵循以下实践:

  1. 变量声明时思考内存 :当写下 int count; 时,立刻想到“在栈上分配4字节,地址为&count”。
  2. 指针即地址 :看到 char *str; ,理解为“ str 是一个变量,里面存放着一个内存地址,当我写 *str 时,会去读那个地址开始的1个字节并解释为 char ”。
  3. 数组即连续地址块 :看到 int arr[10]; ,理解为“分配了连续40字节内存, arr 是这块内存首地址的别名, arr[i] 等价于 *(arr + i*4) ”。
  4. 结构体即内存布局图 :画图理解结构体各成员的偏移和填充,这对网络编程和文件IO至关重要。
  5. 函数传参思考传递了什么 :C语言是“值传递”。传递指针时,传递的是地址值的副本。在函数内修改指针指向的内容会影响原数据,但修改指针本身(让它指向别处)不影响外部的指针变量。
  6. 调试时查看内存 :遇到诡异bug时,不要只盯着变量值看。使用调试器查看相关内存地址的原始字节内容,往往能发现端倪(比如越界写入、未初始化数据)。

9. 总结

回到最初的观点:“【C】数据类型不存在,有的仅仅是内存地址和读取的大小”。通过本文的层层剖析与实验,我们可以确信,在C语言程序运行的机器层面,这个观点是成立的。

  • 编译期 :数据类型是强大的工具。它让编译器能进行类型检查、生成正确的机器指令(如整数加法指令 add vs 浮点数加法指令 fadd )、计算偏移量和大小。
  • 运行期 :数据类型的光环褪去,内存中只有冰冷的比特位。变量名、类型名都消失了,只剩下地址和在此地址上进行的、特定宽度的加载(Load)与存储(Store)操作。

拥抱这一视角,意味着你从C语言的“用户”变成了“合作者”。你不仅在使用语言提供的抽象,更是在理解并驾驭其背后的物理现实。这会使你编写的代码更加健壮、高效,也能让你在面对最棘手的内存相关Bug时,拥有直指核心的洞察力。

下次当你写下 int *p = &a; 时,希望你能清晰地看到: p 里存着一个数字(地址),而 *p 这个操作,是命令CPU去那个数字标识的地方,取回4个字节,并按补码规则翻译成一个整数。这就是C语言的精髓,也是系统编程的起点。

「LLM那些事」系列第 4 篇《上下文窗口的边界》,文章连接:https://blog.csdn.net/houwenjin/article/details/163999753。 演示什么:在「预测」Sheet 的黄色格子里输入一句话(默认「来泡一杯」),四个「模型」——分别只统计最后 1 / 2 / 3 / 4 个字的 n-gram 查表——同时预测下一个字。同一个输入,看的上下文越长,候选越少、预测越确定: ┌────────────────┬──────────┬───────────────┬──────┐ │ 只看最后几个字 │ 用的前缀 │ 候选下一字数 │ 预测 │ ├────────────────┼──────────┼───────────────┼──────┤ │ 1 个 │ 杯 │ 3(茶/子/水) │ 模糊 │ ├────────────────┼──────────┼───────────────┼──────┤ │ 2 个 │ 一杯 │ 2(茶/水) │ 收窄 │ ├────────────────┼──────────┼───────────────┼──────┤ │ 3 个 │ 泡一杯 │ 1(茶) │ 确定 │ ├────────────────┼──────────┼───────────────┼──────┤ │ 4 个 │ 来泡一杯 │ 1(茶) │ 确定 │ └────────────────┴──────────┴───────────────┴──────┘
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值