本发明涉及地球物理领域,具体涉及一种基于cxdf算法的火成岩流体识别方法。
背景技术:
1、火成岩储层广泛分布于地球上主要的含油盆地中。随着油气勘探和开发技术的进步,行业逐渐向复杂岩性的火成岩储层扩展,这为油气产量和储量的增长开辟了新的途径。为了有效开发此类储层,准确识别储层流体至关重要。传统的储层流体识别方法包括标准水层比较法、储层最小电阻率法、径向电阻率法和邻井曲线比较法。然而,这些方法常常受到储层条件的限制,例如岩性不一致和地层水盐度相似,导致流体识别面临困难。尽管已有多种机器学习方法(如支持向量机、极端梯度提升和随机森林)用于油藏评价,目前尚未有将机器学习方法应用于复杂岩性火成岩储层流体识别的相关研究。
2、集成学习方法通过将多个弱学习器组合成一个强学习器,既保留了弱学习器的特点,又提升了模型的整体效果。典型的集成学习方法包括随机森林、adaboost、gbrt和xgboost。这些方法已广泛应用于岩性识别、薄层识别和储层物性反演。集成学习方法为复杂岩性火成岩储层的开发提供了潜在的优势。然而,常规测井数据集的不平衡性对流体识别构成挑战,基于不平衡数据的分类模型可能会偏向于多数类样本,为此需要对数据集进行重新平衡。
技术实现思路
1、本发明针对上述现有技术存在的缺陷,提供了一种基于cxdf算法的火成岩流体识别方法。本发明基于自适应多目标群交叉优化算法解决了初始数据集不平衡的问题,并采用极端梯度提升树算法和深度森林算法相结合的集成学习方法,能够实现对复杂岩性火成岩储层流体的有效识别。
2、本发明提供的一种基于cxdf算法的火成岩流体识别方法,具体包括以下模块:
3、s1数据预处理:获取研究区的岩心和测井数据,将数据整理成xlsx格式的表格文件;对指定的测井数据取对数处理;对测井数据归一化处理;预处理后的数据的78%为训练数据集,22%为验证数据集;将训练数据集标签分成两部分,即多烃和低烃。
4、s2模型建立:基于cxdf算法和其他人工智能算法,构建流体识别模型;基于验证数据集构建模拟井;根据流体识别模型识别模拟井。
5、s3模型优选:基于表格、雷达图和柱状图进行模型评价和模型对比;确定最佳的流体识别模型。
6、优选的,s1所述的研究区的流体类型包括干层、低产油层、水层、油层、低产水层、含油水层和气层。
7、优选的,s1所述的研究区的岩性包括玄武岩、粗面岩、辉绿岩、安山岩和凝灰岩。
8、优选的,s1所述的测井数据包括中子(cnl)、密度(den)、自然伽马(gr)、深侧向电阻率(rlld)和微侧向电阻率(rmll)。其中,s1所述的指定的测井数据为深侧向电阻率(rlld)和微侧向电阻率(rmll)。
9、优选的,s1所述的多烃包括油层和气层;s1所述的低烃包括干层、低产油层、水层、低产水层和含油水层。
10、优选的,s2所述的cxdf算法是基于自适应多目标群交叉优化(amsco)算法的优化数据集,并结合xgboost算法和深度森林(df)算法的集成学习模型。
11、优选的,所述的amsco算法提出了一种自适应优化的数据采样模型,旨在解决分类场景下的数据不平衡问题。针对模型的自适应特性,提出了一种可靠精度(ra)的复合评价标准。
12、优选的,所述的amsco算法的再平衡过程,具体包括:将预处理后的训练数据集读取为当前训练数据集;基于当前训练数据集评估可靠精度;将未满足标准的当前训练数据集分为少数类和多数类两个子集;少数类子集利用过采样技术(osmote)优化,多数类子集利用组实例选择技术(sis(o_major))优化;将两种优化作为一个统一的迭代器耦合在一起,即通过迭代交叉两种优化的结果,逐步增强两种优化的数据混合效果,直到生成一个高质量的数据集。
13、优选的,s3模块所述的雷达图基于fbeta、精准率和召回率三种评价指标显示出流体识别模型对模拟井中7种流体的识别效果。其中,所述的fbeta是一种用于评估二元分类模型准确性的统计度量,不同的beta值对应于召回率和准确率的不同权重。
14、进一步的,基于表格、雷达图和柱状图的综合识别效果,确定最佳的火成岩流体识别模型,以实现对复杂岩性火成岩流体的准确识别。
1.本发明提供的一种基于cxdf算法的火成岩流体识别方法,其特征在于,具体包括以下模块:
2.根据权利要求1所述的一种基于cxdf算法的火成岩流体识别方法,其特征在于:s1所述的研究区的流体类型包括干层、低产油层、水层、油层、低产水层、含油水层和气层。
3.根据权利要求1所述的一种基于cxdf算法的火成岩流体识别方法,其特征在于:s1所述的研究区的岩性包括玄武岩、粗面岩、辉绿岩、安山岩和凝灰岩。
4.根据权利要求1所述的一种基于cxdf算法的火成岩流体识别方法,其特征在于:s1所述的测井数据包括中子(cnl)、密度(den)、自然伽马(gr)、深侧向电阻率(rlld)和微侧向电阻率(rmll),同时s1所述的指定的测井数据为深侧向电阻率(rlld)和微侧向电阻率(rmll)。
5.根据权利要求1所述的一种基于cxdf算法的火成岩流体识别方法,其特征在于:s1所述的多烃包括油层和气层;s1所述的低烃包括干层、低产油层、水层、低产水层和含油水层。
6.根据权利要求1所述的一种基于cxdf算法的火成岩流体识别方法,其特征在于:s2所述的cxdf算法是基于自适应多目标群交叉优化(amsco)算法的优化数据集,并结合xgboost算法和深度森林(df)算法的集成学习模型。
7.根据权利要求6所述的一种基于cxdf算法的火成岩流体识别方法,其特征在于:所述的amsco算法提出了一种自适应优化的数据采样模型,旨在解决分类场景下的数据不平衡问题,针对模型的自适应特性,提出了一种可靠精度(ra)的复合评价标准,其表达式如下:
8.根据权利要求6或7所述的一种基于cxdf算法的火成岩流体识别方法,其特征在于:所述的amsco算法的再平衡过程,具体包括:
9.根据权利要求1所述的一种基于cxdf算法的火成岩流体识别方法,其特征在于:s3所述的雷达图基于fbeta、精准率和召回率三种评价指标显示出流体识别模型对模拟井中7种流体的识别效果,同时所述的fbeta是一种用于评估二元分类模型准确性的统计度量,不同的beta值对应于召回率和精确率的不同权重,其表达式如下:
