Journal of the Korean Solar Energy Society. 30 August 2026. 1-13
https://doi.org/10.7836/kses.2026.46.4.001

ABSTRACT


MAIN

  • 1. 서 론

  • 2. 태양광 발전량 예측을 위한 입력 변수 구성

  • 3. 결과 및 토의

  •   3.1 입력 데이터 구성

  •   3.2 실험 방법

  •   3.3 실험 결과

  • 4. 결 론

기호 및 약어 설명

PV : Photovoltaic

MAE : Mean Absolute Error

NMAE : Normalized Mean Absolute Error

RMSE : Root Mean Square Error

MSE : Mean Squared Error

LSTM : Long Short-Term Memory

LightGBM : Light Gradient Boosting Machine

1. 서 론

태양광 설비용량의 지속적인 증가에 따라 발전량 예측 정확도의 향상은 전력계통의 안정적 운영과 전력시장 운영 효율성 제고를 위한 중요한 기술적 과제로 인식되고 있다. 단기 및 일 단위 발전량 예측은 수급 계획 수립, 예비력 운용, 재생에너지 변동성 대응 전략과 밀접하게 연계되며, 예측 성능은 전력 시스템의 운영 효율성과 직결된다. 이러한 발전량 예측 모델은 출력 예측에 국한되지 않고 설비 상태 진단 및 운영 최적화를 위한 핵심 기반 기술로 활용된다.태양광 모듈의 열화 및 국부적 손상과 같은 성능 저하 요인은 출력 저하로 이어지며, 이는 장기적인 발전 효율 감소를 초래할 수 있다. 따라서 이러한 이상 상태를 상시적으로 진단하기 위한 기술의 중요성이 점차 확대되고 있다. 태양광 발전 시스템의 이상 상태를 조기에 탐지하기 위해서는 정상 운전 조건에서의 예측 출력과 실제 발전량 간의 편차를 정량적으로 분석할 수 있어야 하며, 이를 위해 신뢰성 높은 발전량 예측 모델의 구축이 필수적이다1).

국내에서는 태양광 발전량 예측을 위하여 기상 관측 자료 기반의 통계적 모형, 시계열 모형, 인공신경망 및 LSTM (Long Short-Term Memory) 기반 기법 등이 활발히 연구되어 왔다2,3,4). 대부분의 연구는 지표면 전천일사량, 기온, 운량, 일조시간 등 기본적인 기상 변수를 중심으로 모델을 구성하고 있으며, 일부에서는 수치기상예보 자료를 활용하여 입력 변수의 범위를 확장하려는 시도도 이루어졌다5). 그러나 이러한 연구는 주로 예측 정확도 향상에 초점을 두고 있으며, 입력 특징이 발전량에 미치는 영향에 대한 구조적 분석은 상대적으로 부족한 실정이다.

국외 연구에서는 태양 위치 정보, 다중 기상 예보 자료, 자기회귀 특성, 변화율 및 지연 변수 등을 포함한 다양한 입력 구성이 제안되고 있으며6,7,8), 발전량 예측 모델을 정상 운전 조건을 반영한 참조 모델로 활용하여 실측값과의 편차를 분석함으로써 이상 상태를 탐지하는 연구도 보고되고 있다9). 특히 단기 변동성이 큰 구간을 설명하기 위하여 변화량 기반 특징이나 과거 출력 정보를 포함하는 접근이 적용되고 있으나, 국내에서는 이러한 특징군을 체계적으로 확장·비교하고 각 특징의 기여도를 정량적으로 분석한 연구 사례는 많지 않다.

태양광 발전량은 태양 기하학적 조건에 따른 일중·계절 주기 성분, 대기 상태 및 구름 분포에 따른 기상 변동 성분, 과거 출력에 기반한 자기회귀적 특성, 그리고 기상 변화에 따른 단기 동역학적 변동이 복합적으로 작용하여 결정된다. 이에 본 연구에서는 입력 특징 구성에 따른 태양광 발전량 예측 성능 변화를 분석하였다. 입력 특징은 태양 위치 및 계절성을 반영하는 결정론적 변수, 기상 상태를 나타내는 환경 변수, 과거 발전량 및 동일 시간대 평균을 포함하는 자기회귀 특성, 그리고 기상 변수의 변화량과 지연 정보를 포함하는 동역학적 특성으로 구성하였다. 각 특징군의 예측 성능은 트리 기반 모델인 LightGBM과 시계열 기반 딥러닝 모델인 LSTM을 적용하여 비교·평가하였다.

2. 태양광 발전량 예측을 위한 입력 변수 구성

태양광 발전량은 단일 기상 변수만으로 설명되기 어려우며, 태양 위치 및 계절성에 의해 결정되는 주기 성분, 구름·습도·풍속 등 대기 상태에 따른 감쇠 및 변동 성분, 과거 출력에 의해 나타나는 시간적 관성(지연·반복성), 그리고 구름 이동과 같은 외란에 의한 단기 급변 성분이 복합적으로 작용하여 결정된다. 따라서 입력 변수 구성은 단순히 다수의 변수를 포함하는 것이 아니라, 발전량 변동을 유발하는 요인을 기능적으로 분해하고 각 요인의 추가가 예측 성능에 미치는 영향을 비교 가능하도록 설계할 필요가 있다. 본 연구에서는 태양광 발전량에 영향을 미치는 요인을 기능적 역할에 따라 체계적으로 분리하고, 각 특징군이 예측 성능에 미치는 영향을 단계적으로 분석할 수 있도록 입력 특징을 기본 특징군(A), 기상 상태 특징군(B), 자기회귀 특징군(C), 동역학 및 지연 특징군(D)의 네 가지로 구분하였다. 각 특징군은 기본적인 물리 기반 정보에서 출발하여 기상 상태, 출력의 시간적 의존성, 단기 동역학 특성을 단계적으로 반영하도록 구성하였다.

기본 특징군(A)은 Table 1에서 보는 바와 같이 태양광 발전량의 가능 범위와 주기적 패턴을 설명하는 최소 구성으로 정의하였다. 대표적으로 지표면 전천일사량 GHIt는 모듈에 실제로 입사되는 복사 에너지의 크기를 직접 반영하므로 발전량을 설명하는 가장 핵심적인 물리 변수이다. 여기에 대기권 외 일사량 TOAt를 함께 포함함으로써, 동일한 GHI 조건에서도 계절·시간에 따라 달라지는 태양 고도 및 이론적 상한을 보조적으로 반영할 수 있다.

기상 상태 특징군(B)은 Table 2에서 보는 바와 같이 동일한 태양 위치 조건에서도 발전량을 크게 변화시키는 대기 상태 요인을 반영하기 위해 구성하였다. Sunshine_hours (St), Cloud_3 (C3t), Cloud_10 (C10t)은 구름에 따른 일사 감쇠를 직접 또는 간접적으로 나타내는 변수들이다. 특히 Cloud_10은 Cloud_3보다 세밀한 해상도로 구름량을 표현하므로 구름 상태의 정밀한 구분이 필요한 상황에서 유리할 수 있다. RH (RHt)는 안개·연무 등 대기 습윤 상태와 연동되어 일사 조건을 간접적으로 반영하며, WS (WSt)는 대기 혼합/구름 이동 및 모듈 냉각과 관련된 보조 요인으로 포함하였다. 또한, 본 연구는 순간값만 사용하는 경우 관측 노이즈 또는 단기 스파이크가 모델 학습을 불안정하게 만들 수 있다는 점을 고려하여, 이동평균(moving average) 기반 특징을 함께 설계하였다. 이를 위해 GHIt-3는 최근 3시간 평균값으로 정의하여 단기 변동을 완화하고 구름 통과에 따른 순간적 변동을 평활화하도록 구성하였다. 또한 GHIt-24는 24시간 평균 수준을 반영하여 해당 일자의 전반적인 일사 조건을 나타내도록 설계하였다. Sunshine, Cloud, Temperature, RH, WS에 대해서도 24시간 이동평균을 포함하여 현재 시점의 순간 관측값과 최근 일정 기간의 상태를 동시에 반영하도록 구성하였다.

자기회귀 특징군(C)은 Table 3에서 보는 바와 같이 발전량 자체가 갖는 강한 시간적 연속성과 반복성을 반영하기 위해 구성하였다. PV 출력은 구름 변화로 급변하기도 하지만, 단기 구간에서는 일정한 관성(inertia)을 보이는 경우가 많다. 이에 따라 1시간 지연 Pt-1, 2시간 지연 Pt-2는 전일 동일 시간대 출력으로, PV의 일주기 패턴과 유사 시간대 조건을 직접적으로 반영하는 대표적 기억 변수이다. 추가적으로 본 연구는 단일 전일 값이 이상치(특정 하루의 비정상 기상/운영) 영향을 받을 수 있다는 점을 고려하여, 동일 시간대의 과거 평균을 설계하였다. P3d는 최근 3일 동일 시간대 평균으로 단기 기준선을 제공하며, P5d는 조금 더 완만한 평균 기준선을 제공한다. 이는 오늘 13시는 최근 며칠의 13시와 유사하다는 경험적·물리적 직관을 통계적으로 반영한 것으로, 단기 예측에서 안정적인 기준선 역할을 한다. 또한 Pt-6, Pt-24는 각각 6시간/24시간 이동평균으로 순간값의 변동을 완화하고 현재 발전 상태를 안정적으로 요약한다.

동역학 및 지연 특징군(D)은 Table 4에서 보는 바와 같이 상태만으로 설명하기 어려운 급격한 변동을 포착하기 위해 추가한 확장 특징이다. PV 출력 급변은 주로 구름 이동, 전선 통과, 국지적 대기 변화와 연관되며, 이때 중요한 것은 절대값 자체뿐 아니라 변화의 방향과 속도이다. 이를 반영하기 위해 △GHIt,1 = GHIt – GHIt-1와 같은 1시간 변화량을 포함하여 단기 일사 변화의 민감도를 높였다. 또한 △GHIt,24 = GHIt – GHIt-24 전일 대비 변화로, 어제 같은 시간 대비 개선/악화를 반영하는 비교 기준으로 활용될 수 있다. 또한 D 특징군에는 주요 기상 변수의 전일 동일 시간 지연값(GHIt-1, GHIt-24, RHt-24, WSt-24, Tt-24, C10t-24, St-24)을 포함하였다. 이는 PV 출력뿐 아니라 원인 변수(기상 변수)의 일주기 반복성을 반영하여, 단순히 출력 기억에만 의존하지 않고 기상 조건의 반복성까지 함께 고려하도록 설계하였다.

본 연구의 입력 특징 구성은 기본 특징군(A)을 통해 태양광 발전량의 물리적 기준선을 설정하고, 기상 상태 특징군(B)을 추가하여 구름 및 대기 상태에 따른 환경 변동을 반영한다. 이어 자기회귀 특징군(C)을 포함함으로써 출력의 시간적 관성과 일주기 반복성을 고려하여 예측의 안정성을 강화하였다. 마지막으로 동역학 및 지연 특징군(D)을 통해 일사량과 기상 변수의 변화량 및 지연 정보를 반영함으로써 단기 급변 구간과 반복 패턴에 대한 민감도를 보완하도록 구성하였다.

Table 1

Basic feature group-A

Feature Name Symbol Unit Definition Description
GHI_surface GHIt W/m2 Global horizontal irradiance
at time
Primary physical variable that directly
determines photovoltaic power generation
TOA_irradiance TOAt W/m2 Top-of-atmosphere irradiance
at time
Theoretical upper bound of solar
irradiance determined by solar position
hour_sin sin(2πht/24) Sinusoidal transformation
of hour-of-day
Represents the 24-hour periodic cycle
hour_cos cos(2πht/24) Cosine transformation
of hour-of-day
Preserves temporal continuity of hourly
data
doy DOYt day Day of year at time Reflects seasonal variation
Temperature Tt Ambient air temperature at time Represents module efficiency effects
and environmental conditions
Table 2

Meteorological state feature group-B

Feature Name Symbol Unit Definition Description
Sunshine_hours St hr Sunshine duration at time t Reflects clear or cloudy atmospheric
conditions
Cloud_3 C3t okta Cloud cover in 3-level scale
at time t
Represents short-term cloud distribution
Cloud_10 C10t okta Cloud cover in 10-level scale
at time t
Provides refined representation of
cloud amount
RH RHt % Relative humidity at time t Represents atmospheric state
WS WSt m/s Wind speed at time t Represents cooling effect and
atmospheric mixing
GHI_surface_roll
_mean3
GHIt-3 W/m2 3-hour moving average of global
horizontal irradiance
Reduces short-term irradiance
fluctuations
GHI_surface_roll
_mean24
GHIt-24 W/m2 24-hour moving average of
global horizontal irradiance
Summarizes daily irradiance level
Sunshine_hours
_roll_mean24
St-24 hr 24-hour moving average
of sunshine duration
Reflects persistence of weather
conditions
Cloud_10_roll
_mean3
C10t-3 okta 3-hour moving average of cloud
cover (10-level)
Represents short-term cloud trend
Cloud_10_roll
_mean24
C10t-24 okta 24-hour moving average of
cloud cover (10-level)
Reflects prevailing weather regime
Temperature_roll
_mean24
Tt-24 24-hour moving average
of ambient temperature
Represents thermal environment
RH_roll_mean24 RHt-24 % 24-hour moving average
of relative humidity
Summarizes atmospheric moisture
condition
WS_roll_mean24 WSt-24 m/s 24-hour moving average of
wind speed
Represents average cooling condition
Table 3

Autoregressive feature group-C

Feature Name Symbol Unit Definition Description
Target_per_MW
_lag1
Pt-1 MW/MW Power output one hour before time t Reflects short-term inertia
Target_per_MW
_lag2
Pt-2 MW/MW Power output two hours before time t Smooths short-term trend
Target_per_MW
_lag24
Pt-24 MW/MW Power output at the same hour on
the previous day
Captures daily periodicity
Target_per_MW_
mean_3d_same_time
P3d MW/MW Average power output at the same time
over the previous 3 days
Short-term baseline reference
Target_per_MW_
mean_5d_same_time
P5d MW/MW Average power output at the same time
over the previous 5 days
Medium-term baseline reference
Target_per_MW_
roll_mean6
Pt-6 MW/MW 6-hour moving average of power output Stabilizes short-term state
Target_per_MW_
roll_mean24
Pt-24 MW/MW 24-hour moving average of power output Represents daily average state
Table 4

Dynamic and lagged feature group-D

Feature Name Symbol Unit Definition Description
GHI_surface_
diff1
△GHIt,1 W/m2 GHIt–GHIt-1 Short-term irradiance variation
GHI_surface_
diff24
△GHIt,24 W/m2 GHIt–GHIt-24 Change relative to the previous day
GHI_surface_lag1 GHIt-1 W/m2 Global horizontal irradiance one hour
before time t
Reflects short-term persistence
GHI_surface_lag24 GHIt-24 W/m2 Global horizontal irradiance at the same
hour on the previous day
Captures daily periodicity
RH_lag24 RHt-24 % Relative humidity at the same hour on
the previous day
Reflects atmospheric repetition
WS_lag24 WSt-24 m/s Wind speed at the same hour on the
previous day
Represents ventilation condition
Temperature_lag24 Tt-24 Ambient temperature at the same hour on
the previous day
Reflects thermal periodicity
Cloud_10_lag24 C10t-24 okta Cloud cover (10-level scale) at the same
hour on the previous day
Captures cloud periodicity
Sunshine_hours_
lag24
St-24 hr Sunshine duration at the same hour on
the previous day
Reflects weather periodicity

3. 결과 및 토의

3.1 입력 데이터 구성

본 연구는 공공데이터포털(www.data.go.kr)을 통해 제공되는 한국동서발전(주)의 전국 태양광 발전량 예측 학습 데이터를 활용하였다. 해당 데이터는 전국 17개 지역으로 구분되어 구성되어 있으며, 본 연구에서는 이 중 충청북도 지역 데이터를 이용하여 입력 및 출력 데이터를 구성하였다. 분석에 사용된 데이터는 2020년 1월 1일부터 2024년 12월 31일까지의 5년간 시간 단위 자료로, 기상 요인과 발전 설비 특성을 기반으로 태양광 발전량 예측을 목적으로 구축된 학습용 데이터이다. 주요 구성 항목은 시도명, 설비용량(MW), 발전일자, 기온(℃), 강우량(mm), 습도(%), 적설량(mm), 풍속(m/s), 적운량(10분위 및 3분위), 일조시간(hr), 일사량(W/m2), 대기권 밖 일사량 계산값, 발전량(MWh) 등으로 구성되어 있다.

본 연구에서는 제공된 원시 데이터 중 예측 성능에 유의한 영향을 미칠 것으로 판단되는 항목을 선별하여 입력 변수로 활용하였다. 강우량 및 적설량 변수는 결측값 비율이 높아 신뢰성 있는 학습이 어렵다고 판단되어 입력 변수에서 제외하였다. 또한 윤년 여부는 발전량에 미치는 영향이 제한적일 것으로 판단되어 입력 변수로 고려하지 않았다. 이에 따라 설비용량, 발전일자, 기온, 습도, 풍속, 적운량(10분위 및 3분위), 일조시간, 일사량, 대기권 밖 일사량 계산값, 발전량 등을 기반으로 특징을 구성하였다. 먼저, 기본 특징군(A)은 태양광 발전량의 물리적 기준과 시간적 주기성을 반영하기 위한 입력 변수로 구성하였다. GHI_surface와 TOA_irradiance는 각각 원시 일사량 데이터와 대기권 밖 일사량 계산값을 사용하였다. hour_sin과 hour_cos는 발전일자의 시간 정보를 이용하여 sin(2πht/24), cos(2πht/24) 형태로 변환하였으며, doy는 발전일자로부터 연중 일자를 계산하여 생성하였다. Temperature는 원시 기온 데이터를 그대로 사용하였다.

기상 상태 특징군(B), 자기회귀 특징군(C), 동역학 및 지연 특징군(D)에 해당하는 변수들 역시 제공된 원시 데이터를 기반으로 직접 활용하거나, 이동평균 및 지연 변환을 통해 파생 변수로 생성하였다. 예를 들어, 기상 상태의 지속성을 반영하기 위하여 3시간 및 24시간 이동평균을 산출하였으며, 자기회귀 특성을 반영하기 위하여 과거 발전량 지연값(lag)과 동일 시간대 평균을 계산하였다. 또한 단기 급변을 반영하기 위해 일사량 변화량 및 전일 동일 시각 기상 변수의 지연값을 생성하였다. 이와 같이 원시 관측 데이터와 파생 변수를 결합하여 네 개의 특징군(A–D)을 체계적으로 구성하였다.

3.2 실험 방법

최근 태양광 발전량 예측 연구에서는 다양한 기상 변수와 시간 변수, 과거 발전량 이력 등을 활용하는 트리 기반 앙상블 모델과 순환신경망 계열 모델이 널리 활용되고 있다. 특히 LightGBM (Light Gradient Boosting Machine)과 같은 그래디언트 부스팅 기반 모델은 결정트리 기반의 앙상블 학습 기법으로, 비선형 관계를 효과적으로 학습할 수 있으며, 이질적인 변수 분포와 다수의 입력 특징을 안정적으로 처리할 수 있어 단기 태양광 발전량 예측 분야에서 우수한 성능이 보고되고 있다7,10). 또한 트리 기반 모델은 변수 중요도 분석이 가능하여 입력 특징군의 상대적 기여도를 평가하는 연구에 적합하다는 장점이 있다. 한편, LSTM 기반 모델은 시계열 데이터의 시간적 의존성을 학습하는 데 효과적이어서 태양광 발전량 단기 예측 분야에서 폭넓게 활용되어 왔다6,11). 최근에는 다중 기상 예보 정보를 활용하기 위하여 LSTM과 어텐션 메커니즘을 결합하거나 트랜스포머 구조를 적용한 연구도 보고되고 있다12). 이러한 연구들은 시계열 정보와 기상 예보 정보를 통합한 딥러닝 기반 접근 방식이 태양광 발전량 예측 성능 향상에 효과적임을 보여준다.

이에 본 연구에서는 모델 구조에 따른 편향을 최소화하고 입력 특징군의 영향이 서로 다른 모델에서 일관되게 나타나는지를 검증하기 위하여, 트리 기반 모델인 LightGBM과 시계열 기반 딥러닝 모델인 LSTM을 기준 모델로 선정하였다. 모델 학습을 위해서는 입력 변수와 목표값의 설정이 필요하다. 입력 변수는 3.1절에서 설명한 바와 같이 구성요소별로 구축하였으며, 목표값은 실제 발전량을 직접 사용하는 방식과 태양광 발전량을 설비용량으로 나눈 정규화 에너지를 사용하는 방식으로 설정할 수 있다.

목표값 설정 방식의 적절성을 검토하기 위하여 2020년부터 2024년까지 충청북도 지역의 태양광 발전량을 분석하였다. Fig. 1(a)에 나타난 바와 같이 해당 기간 동안 태양광 발전량은 연도별로 증가하는 경향을 보인다. 이러한 증가 추세를 고려하지 않고 발전량을 직접 모델링할 경우, 설비용량 확대에 따른 구조적 변동이 오차 요인으로 작용할 가능성이 있다. 따라서 본 연구에서는 Fig. 1(b)에 제시된 바와 같이 태양광 발전량을 설비용량으로 나눈 정규화 에너지를 모델의 목표값으로 설정하여 학습을 수행하였다. 최종 발전량 예측값은 예측된 정규화 에너지에 설비용량을 곱하여 산출하였다. 또한 모델의 예측 성능을 평가하기 위하여 Table 5에 제시된 평균 절대 오차(MAE: Mean Absolute Error), 정규화 평균 절대 오차(NMAE: Normalized Mean Absolute Error), 평균 제곱근 오차(RMSE: Root Mean Square Error), 그리고 평균 제곱 오차(MSE: Mean Squared Error)를 사용하였다. Table 5에서 yi는 실제 발전량, y^i는 예측 발전량, N은 데이터 개수, y¯는 실제 발전량의 평균, Cii번째 샘플의 설비용량을 각각 의미한다.

https://cdn.apub.kr/journalsite/sites/kses/2026-046-04/N0600460401/images/kses_2026_464_1_F1.jpg
Fig. 1

PV power generation and normalized PV energy during 2020–2024

Table 5

Performance evaluation metrics used in this study

Metric Formula Sensitivity to Outliers Suitability for PV Forecasting
MAE 1Ni=1N|yi-y^irightvert Low Very high
NMAE 1Ni=1Nyi-y^iCi Low Suitable for regional comparison
RMSE 1Ni=1N(yi-y^i)2 High Suitable for evaluating peak errors
MSE 1Ni=1N(yi-y^i)2 Very high Commonly used as a training objective

3.3 실험 결과

Table 6은 입력 특징군 조합에 따른 실험 모델 구성을 나타낸다. 기본 특징군(A)을 기반으로 기상 상태 특징군(B), 자기회귀 특징군(C), 그리고 동역학 및 지연 특징군(D)을 단계적으로 추가하여 총 8개의 모델(M1–M8)을 구성하였다. M1은 기본 특징군(A)만을 사용한 최소 구성 모델이며, M2–M4는 각각 A에 B, C, D를 개별적으로 결합한 구조이다. M5–M7은 두 개의 특징군을 동시에 추가한 조합 모델이며, M8은 네 가지 특징군(A + B + C + D)을 모두 포함한 전체 입력 모델이다. 입력 변수의 개수는 6개에서 35개까지 점진적으로 증가하도록 설계하였으며, 이를 통해 특징군 확장에 따른 예측 성능 변화를 체계적으로 비교하고자 하였다.

Table 6

Experimental model configurations based on feature group combinations

Model Feature Groups Number of Features
M1 A (Basic feature group) 6
M2 A + B (Meteorological state feature group) 19
M3 A + C (Autoregressive feature group) 13
M4 A + D (Dynamic and lagged feature group) 15
M5 A + B + C 26
M6 A + B + D 28
M7 A + C + D 22
M8 A + B + C + D 35

본 연구에서는 입력 특징군 구성에 따른 예측 성능 변화를 비교하기 위하여 트리 기반 모델인 LightGBM과 시계열 기반 딥러닝 모델인 LSTM을 적용하였다. 학습 데이터는 2020년부터 2022년까지의 충청북도 지역 태양광 발전량 데이터를 사용하였으며, 테스트 성능 평가는 2023년과 2024년 데이터를 이용하여 수행하였다. 또한 태양광 발전량이 극히 낮은 구간은 예측의 실효성이 제한적이므로, TOA_irradiance가 0인 데이터는 분석에서 제외하였다. 모델 학습을 위한 목표값은 실제 발전량을 설비용량으로 나눈 정규화 발전량을 사용하였다. 입력 변수의 전처리는 모델 특성에 따라 다르게 적용하였다. 즉, LightGBM 모델은 트리 기반 구조로 입력 변수의 크기에 상대적으로 민감하지 않으므로 별도의 정규화 과정 없이 학습에 사용하였다. 반면 LSTM 모델은 경사 기반 학습 구조의 특성을 고려하여, 학습 데이터의 평균과 표준편차를 기준으로 표준화(standardization, z-score normalization)를 수행한 후 모델에 입력하였으며, 테스트 데이터 또한 동일한 기준으로 변환하였다.

LightGBM 모델은 성능 안정화를 위하여 일부 하이퍼파라미터를 조정하였다. 구체적으로 n_estimators = 4500, learning_rate = 0.02, num_leaves = 49, min_child_samples = 30, reg_lambda = 1.0, subsample = 0.80, colsample_bytree = 0.80으로 설정하였으며, random_state는 42로 고정하였다. 추가적인 자동 하이퍼파라미터 탐색은 수행하지 않고 동일한 설정을 모든 특징군 조합에 일관되게 적용하였다.

LSTM 모델의 입력 시퀀스 길이는 12로 고정하여 최근 12시간의 과거 정보를 기반으로 다음 시점 발전량을 예측하도록 구성하였다. 네트워크는 32개의 은닉 유닛을 갖는 LSTM 계층과 32노드의 완전연결 계층으로 구성하였으며, 과적합 완화를 위하여 dropout 비율 0.25를 적용하였다. 최적화 알고리즘은 Adam (learning_rate = 0.001)을 사용하였으며, 학습 epoch 수는 최대 60, 배치 크기는 128로 설정하였다. 학습 과정에서는 손실이 개선되지 않을 경우 학습률을 감소시키는 ReduceLROnPlateau와 일정 기간 손실 개선이 없을 경우 학습을 종료하는 조기 종료(early stopping, patience = 8, min_delta = 1e – 4)를 함께 적용하였다.

학습 데이터를 이용하여 모델을 학습한 후, 테스트 데이터를 적용하여 모델 구성별 성능을 평가하였다. 성능 비교는 일반화 성능에 초점을 두어 테스트 데이터 결과를 중심으로 분석하였다. 두 모델의 비교는 특징군 구성 변화에 따른 성능 변화를 확인하기 위한 기준으로 활용하였다. Fig. 2는 입력 특징군 조합(M1–M8)에 따른 LightGBM과 LSTM의 테스트 성능(MAE, NMAE, RMSE, MSE)을 비교한 결과이다. 네 가지 성능 지표 전반에서 유사한 경향이 관찰되었으며, 기본 특징군(A)만을 사용한 경우에 비해 시간 의존 정보가 포함된 조합에서 오차가 감소하였다. 이는 기본 물리·시간 정보만으로는 발전량의 시간적 변동을 충분히 설명하기 어려우며, 자기회귀 특징(C)과 동역학 및 지연 특징(D)이 포함될 경우 시간적 자기상관성과 단기 변동 특성이 함께 반영되어 예측 정확도가 향상된 것으로 해석된다.

https://cdn.apub.kr/journalsite/sites/kses/2026-046-04/N0600460401/images/kses_2026_464_1_F2.jpg
Fig. 2

Performance comparison according to feature group combinations and model types

LightGBM의 경우, 자기회귀 특징군(C) 또는 동역학 특징군(D)이 포함된 시점(M3 또는 M4)에서 성능이 급격히 향상되었으며, 이후 추가적인 특징 확장(M5–M8)에 따른 성능 차이는 거의 나타나지 않았다. 특히 M3 (A + C)는 이후 조합과 동등한 성능을 보이면서도 입력 변수 수가 가장 적어, 입력 변수 수 대비 효율성 측면에서 가장 합리적인 조합으로 해석될 수 있다. 이는 시간 관련 특징이 도입된 이후 모델 성능이 안정화되며, 추가적인 변수 확장은 성능 개선에 거의 영향을 미치지 않음을 확인하였다. 반면 LSTM은 특징군 확장에 따라 성능 변동 폭이 상대적으로 크게 나타났으며, M6 (A + B + D)조합에서 가장 우수한 성능을 보였다. 그러나 모든 특징군을 포함한 M8 (A + B + C + D)에서는 추가적인 성능 개선이 제한적이었다. 이는 LSTM이 시퀀스 구조를 통해 시간 의존성을 학습하는 과정에서, 명시적으로 추가된 Lag, 이동평균, 변화량 특징으로 인해 입력 정보의 중복 또는 복잡도 증가의 영향을 상대적으로 크게 받았기 때문으로 해석된다.

종합적으로, 두 모델 모두 기본 특징군(A)을 기반으로 시간 의존 정보(C 또는 D)가 포함될 때 예측 성능이 크게 향상되는 경향을 보였으며, LightGBM은 최소한의 시간 관련 특징이 포함된 이후 성능이 포화되는 특성을 나타냈다. 이는 자기회귀 특징군(C)이 과거 발전량 정보를 통해 현재 발전량과의 시간적 자기상관성과 일주기 반복 패턴을 반영하기 때문으로 해석된다. 또한 동역학 및 지연 특징군(D)은 일사량 변화량과 전일 동일 시각의 기상 정보를 포함하므로, 구름 이동이나 대기 상태 변화에 따른 단기 급변 구간을 보완적으로 설명하는 데 기여한 것으로 판단된다. 이러한 결과를 바탕으로 입력 변수 수 대비 효율성을 고려할 경우, LightGBM에서는 M3 조합이 가장 합리적인 구성으로 판단된다. 반면 LSTM은 특징 구성에 따라 성능 변화 폭이 상대적으로 크게 나타나, 시간 정보 활용 방식에서 모델 구조적 차이가 존재함을 확인하였다.

Fig. 3은 LightGBM 기반 M3 모델의 시간대별 실제 발전량과 예측 발전량을 비교한 결과이다. M3 모델은 태양 위치 및 시간 기반의 기본 특징군(A)과 자기회귀 특징군(C)으로 구성되었다. 2023년 1월 1일과 1월 10일에 대한 비교 결과, 예측값은 실제 발전량의 일중 변화 패턴을 전반적으로 안정적으로 추종하는 경향을 보였다. 특히 발전량이 증가하는 구간과 감소하는 구간에서 예측 곡선은 실제 곡선과 유사한 기울기와 형태를 나타내며, 최대 발전량 부근에서도 큰 편차 없이 근접한 값을 유지하였다. 이는 해당 특징군 조합이 발전량의 시간적 변화 특성을 효과적으로 반영하고 있음을 시각적으로 보여준다.

https://cdn.apub.kr/journalsite/sites/kses/2026-046-04/N0600460401/images/kses_2026_464_1_F3.jpg
Fig. 3

Comparison of actual and predicted PV energy output for selected days in 2023

4. 결 론

본 연구에서는 태양광 발전량 예측에서 입력 특징군 구성이 예측 성능에 미치는 영향을 분석하기 위해, 태양 위치 및 시간 기반 특징(A), 기상 상태 특징(B), 자기회귀 특징(C), 동역학 및 지연 특징(D)을 단계적으로 확장하고 이를 LightGBM과 LSTM 모델에 적용하여 성능을 비교하였다. 실험 결과, 두 모델 모두 시간 의존 정보를 포함한 특징군(C 또는 D)이 추가될 때 예측 오차가 유의하게 감소하였으며, 특히 LightGBM은 최소한의 시간 관련 특징만으로도 빠르게 성능이 수렴하는 경향을 보였다. 반면 LSTM은 특징 확장에 따라 일부 성능 개선이 있었으나 전반적으로 더 높은 오차를 나타냈다. 이러한 결과는 단순한 변수 수 증가보다 시간적 연속성과 자기상관을 반영한 특징 설계가 중요함을 보여준다. 본 연구는 입력 특징을 기능적 역할에 따라 특징군으로 구성하고, 각 특징군의 단계적 확장이 예측 성능에 미치는 영향을 비교·분석했다는 점에서 특징군 기반 입력 구성의 유용성을 제시하였다. 향후 연구에서는 특징 선택 기법을 통해 핵심 특징을 도출하고, 다양한 지역 및 기간에 대한 추가 실험을 통해 모델의 일반화 성능을 검증할 예정이다.

Acknowledgements

이 논문은 정부(과학기술정보통신부)의 재원으로 정보통신기획평가원의 지원을 받아 수행된 지역지능화혁신인재양성사업임(IITP-2026-RS-2020-II201462).

References

1

Babu, A. R. V., Bharath Kumar, N., Narasipuram, R. P., Periyannan, S., Hosseinpour, A., and Flah, A., Solar Energy Forecasting Using Machine Learning Techniques for Enhanced Grid Stability, IEEE Access, Vol. 13, pp. 93735-93754, 2025, https://doi.org/10.1109/ACCESS.2025.3574093.

10.1109/ACCESS.2025.3574093
2

Lee, D. H., Jung, A. H., Kim, J. Y., Kim, C. K., Kim, H. G., and Lee, Y. S., Solar Power Generation Forecast Model Using Seasonal ARIMA, Journal of the Korean Solar Energy Society, Vol. 39, No. 3, pp. 59-66, 2019.

10.7836/kses.2019.39.3.059
3

Kim, H. J., Lee, S. H., and Park, K. S., Short-Term Photovoltaic Power Forecasting Using LSTM Networks, Journal of the Korean Solar Energy Society, Vol. 40, No. 2, pp. 45-54, 2020.

4

Choi, Y. M. and Lee, J. H., Photovoltaic Power Forecasting Using Artificial Neural Networks, Transactions of the Korean Institute of Electrical Engineers, Vol. 68, No. 5, pp. 812-819, 2019.

5

Park, J. S., Kim, D. H., and Yoo, S. H., Photovoltaic Power Forecasting Using Numerical Weather Prediction Data, Journal of the Korean Solar Energy Society, Vol. 43, No. 4, pp. 25-34, 2023.

10.7836/kses.2023.43.6.087
6

Voyant, C., Notton, G., Kalogirou, S. A., Nivet, M.-L., Paoli, C., Motte, F., and Fouilloy, A., Machine Learning Methods for Solar Radiation Forecasting: A Review, Renewable Energy, Vol. 105, pp. 569-582, 2017.

10.1016/j.renene.2016.12.095
7

Zhang, Y., Wang, J., and Wang, X., Short-Term Photovoltaic Power Forecasting Using Multi-Source Meteorological Features and LightGBM, Applied Energy, Vol. 338, 120926, 2023.

8

Li, G., Shi, J., and Qu, X., Autoregressive Modeling Approach for Photovoltaic Power Forecasting, Energy Conversion and Management, Vol. 125, pp. 319-331, 2016.

9

Garoudja, E., Harrou, F., Sun, Y., Kara, K., Chouder, A., and Silvestre, S., Monitoring and Fault Detection of Photovoltaic Systems Using Machine Learning Techniques, Renewable and Sustainable Energy Reviews, Vol. 77, pp. 310-327, 2017.

10.1016/j.solener.2017.04.043
10

Ke, G., Meng, Q., Finley, T., Wang, T., Chen, W., Ma, W., Ye, Q., and Liu, T. Y., LightGBM: A Highly Efficient Gradient Boosting Decision Tree, Advances in Neural Information Processing Systems 30, Long Beach, CA, USA, pp. 3146-3154, December 2017.

11

Wang, H., Li, G., Wang, G., Peng, J., Jiang, H., and Liu, Y., Deep Learning Based Short-Term Photovoltaic Power Forecasting: A Review and Comparative Study, Energy Reports, Vol. 8, pp. 114-132, 2022.

12

Park, J. M., Lee, D. W., Joe, K., and Yoon, H. S., Transformer-Based Photovoltaic Power Prediction Model Utilizing Multiple Weather Forecasts, Journal of the Korean Solar Energy Society, Vol. 43, No. 6, pp. 87-95, 2023.

10.7836/kses.2023.43.6.087
페이지 상단으로 이동하기