
Machine learning-oplossing voor olievelden
Voorspellen van locaties van olievelden met machine learning voor kosteneffectieve exploratie
problem
De klant, een particuliere olie-exploratie- en productieonderneming die actief is in de VS en Nederland, stond voor een grote uitdaging in het kostbare en tijdrovende proces van het zoeken naar oliereserves. Met de huidige methoden kost het ongeveer $85.000 per vierkante mijl om veldbeoordelingen voor olie uit te voeren, wat neerkomt op ten minste $1 miljoen en potentieel meer dan $40 miljoen aan kosten voordat er resultaten worden behaald. Ondanks het bezit van DNA-monsters van vaste stoffen uit 13 verschillende gebieden met meer dan 3.000 velden met micro-elementkenmerken, zocht de klant naar een efficiëntere methode om olievelden te voorspellen met behulp van deze data.
problem
De klant, een particuliere olie-exploratie- en productieonderneming die actief is in de VS en Nederland, stond voor een grote uitdaging in het kostbare en tijdrovende proces van het zoeken naar oliereserves. Met de huidige methoden kost het ongeveer $85.000 per vierkante mijl om veldbeoordelingen voor olie uit te voeren, wat neerkomt op ten minste $1 miljoen en potentieel meer dan $40 miljoen aan kosten voordat er resultaten worden behaald. Ondanks het bezit van DNA-monsters van vaste stoffen uit 13 verschillende gebieden met meer dan 3.000 velden met micro-elementkenmerken, zocht de klant naar een efficiëntere methode om olievelden te voorspellen met behulp van deze data.
solution
Om de uitdaging van de klant aan te pakken, maakte ons team gebruik van het FloydHub-platform voor gegevensverwerking en modeltraining, waarbij verschillende bibliotheken zoals Scikit-learn, SciPy, Matplotlib en Seaborn werden gebruikt voor verkennende data-analyse (EDA) en visualisatie. Er werd een geautomatiseerde pipeline ontwikkeld om de meest waardevolle kenmerken te selecteren via een reeks algoritmische benaderingen, waaronder correlatieanalyse, L1-geregulariseerde regressoren en dimensionaliteitsreductiemethoden. De modelselectie werd automatisch uitgevoerd, waarbij de meest veelbelovende datasets werden geïdentificeerd voor verdere verfijning door middel van parameterafstemming en de constructie van geavanceerde modellen zoals Deep Neural Networks (DNN) en gradient boosting.
solution
Om de uitdaging van de klant aan te pakken, maakte ons team gebruik van het FloydHub-platform voor gegevensverwerking en modeltraining, waarbij verschillende bibliotheken zoals Scikit-learn, SciPy, Matplotlib en Seaborn werden gebruikt voor verkennende data-analyse (EDA) en visualisatie. Er werd een geautomatiseerde pipeline ontwikkeld om de meest waardevolle kenmerken te selecteren via een reeks algoritmische benaderingen, waaronder correlatieanalyse, L1-geregulariseerde regressoren en dimensionaliteitsreductiemethoden. De modelselectie werd automatisch uitgevoerd, waarbij de meest veelbelovende datasets werden geïdentificeerd voor verdere verfijning door middel van parameterafstemming en de constructie van geavanceerde modellen zoals Deep Neural Networks (DNN) en gradient boosting.
results
Het onderzoeksproces omvatte het identificeren van de belangrijkste kenmerken van het DNA van vaste stoffen en het bepalen van hun belang via analytische methoden, wat leidde tot de creatie van nieuwe datasets. Eerste pogingen tot modeltraining leverden slechts 50% nauwkeurigheid op, wat leidde tot een herbeoordeling van de gegevens. Na het splitsen van de datasets op basis van regionale en seizoensgebonden variaties, verbeterde de nauwkeurigheid met 20%, wat nauwkeurigere voorspellingen van locaties van olievelden mogelijk maakte. Uiteindelijk behaalde het ontwikkelde machine learning-model een nauwkeurigheid van 70% bij het voorspellen van olievelden, waarmee de klant een kosteneffectieve en tijdbesparende oplossing werd geboden voor exploratie- en productieactiviteiten.
results
Het onderzoeksproces omvatte het identificeren van de belangrijkste kenmerken van het DNA van vaste stoffen en het bepalen van hun belang via analytische methoden, wat leidde tot de creatie van nieuwe datasets. Eerste pogingen tot modeltraining leverden slechts 50% nauwkeurigheid op, wat leidde tot een herbeoordeling van de gegevens. Na het splitsen van de datasets op basis van regionale en seizoensgebonden variaties, verbeterde de nauwkeurigheid met 20%, wat nauwkeurigere voorspellingen van locaties van olievelden mogelijk maakte. Uiteindelijk behaalde het ontwikkelde machine learning-model een nauwkeurigheid van 70% bij het voorspellen van olievelden, waarmee de klant een kosteneffectieve en tijdbesparende oplossing werd geboden voor exploratie- en productieactiviteiten.
