摘要:大数据时代背景下, 传统索引(如B+树)面临内存占用过高等问题, 学习型索引以其低内存占用和高查询效率正逐步替代传统索引. 然而, 现有学习型索引难以有效拟合多样化的数据分布, 且易受新数据插入导致分布变化的影响, 引发性能下降. 为解决这些问题, 提出一种基于数据冷热感知的学习型索引HCA-Index. 该索引的核心包括: 设计基于误差阈值的渐进分区算法实现对数据分布的动态拟合; 通过自下而上提取键值范围并采用层级合并策略构建高精度索引; 设计动态演化的数据温度计算模型识别冷热数据; 利用节点级冷热分区支持数据迁移与快速查询. 在真实数据集上进行的实验表明, 相较于传统索引及最新的学习型索引, HCA-Index 在进一步降低内存占用的同时, 显著缩短查询延迟, 并有效减少新数据插入导致的重训练次数.