Les premières défaillances des paliers lisses ont un caractère caché. Afin de prédire avec précision leur amplitude de vibration, un modèle d'apprentissage en profondeur combinant YOLOv8 amélioré avec le module d'attention de bloc de convolution (Convolutional Block Attention Module, CBAM) a été proposé, le CBAM est intégré entre le Backbone et le Neck du modèle pour renforcer l'attention du modèle sur les caractéristiques vibratoires importantes, en même temps, une fonction de perte d'intersection complète améliorée est utilisée pour améliorer la précision de la détection des cibles. De plus, en tenant compte de la non-linéarité et de la non-stationnarité des données vibratoires, une méthode de décomposition empirique des modes (Empirical Mode Decomposition, EMD) a été ajoutée au modèle pour prédire les données d'état de vibration afin d'améliorer la précision de la prédiction. Les résultats montrent que cette méthode, comparée aux YOLOv8 et YOLOv7 traditionnels, a considérablement amélioré la précision de la détection des cibles de 2,85 et 8,50 points de pourcentage respectivement sur l'ensemble de données de fonctionnement de la turbine à vapeur de 600 MW, l'erreur quadratique moyenne et l'erreur moyenne absolue ayant diminué; de plus, dans des environnements à fort bruit, les oscillations des erreurs de ce modèle ont diminué de 30% par rapport aux méthodes traditionnelles, ce qui montre une plus grande capacité de généralisation et de stabilité de ce modèle.