Ⅰ. 서 론
농업용 저수지는 대표적인 수공 구조물로 농촌 유역 상류에 위치하며 농업용수 등 안정적인 수자원 확보 (이수)를 기본적인 목적으로 한다. 기후변화로 인한 이상 호우 발생 빈도의 증가로 인해 농촌 유역 홍수⋅침수 피해 규모가 커짐에 따라 이수 목적과 더불어 홍수 방재 기능 수행을 위한 치수 목적이 대두되고 있다 (Kim et al., 2023).
「농업생산기반시설 관리규정 (2024. 3. 27., 일부개정)」에 따르면 저수지 시설관리자는 홍수기 이전에는 예비방류하여 저류 공간을 확보하는 등 홍수에 대비해야 하고, 홍수기간에는 홍수기 제한수위 준수를 위한 조치를 취해야 한다 (MAFRA, 2024). 농업용 저수지는 이수 기능을 기본 목적으로 갖고 있기에 치수 기능을 강화하는 목적에 앞서 농업용수 공급량을 충분히 확보하면서 동시에 홍수 피해를 사전에 대비할 수 있도록 운영할 필요가 있으며 (Jang et al., 2007b), 하류 하천에 영향을 주지 않도록 적절한 방류 시기와 방류량을 결정함으로써 큰 강우가 올 것을 대비해 저수지 수위를 조절하는 등 수문방류를 시행함으로써 선제적으로 대응하여야 한다.
홍수기 농업용 저수지의 운영과 관련하여 수문방류 등에 대한 합리적인 의사결정은 유입량, 저수량, 방류량 등 3가지 자료에 근거하여야 한다 (Sordo-Ward et al., 2016). 하지만 일부 모니터링 시스템이 갖춰진 유역을 제외하고는 기상자료와 저수지 수위 자료가 저수지 물수지 분석에 활용 가능한 유일한 관측 데이터인 경우가 대부분이며, 유입량과 방류량 자료는 찾아보기 힘든 실정이다 (Song et al., 2022; Kumma et al., 2014; Zhou et al., 2019). 이에 따라 유입량과 방류량 자료가 없는 상태에서 물수지 분석을 수행하기 위하여는 부정정 문제가 대두되며, 합리적 운영 전략 수립을 위하여 다양한 방법이 시도되고 있다 (Yokoo et al., 2001; Jang et al., 2007a; Song et al., 2022).
홍수기 농업용 저수지의 운영 전략 수립 방안은 크게 운영 전략을 가정한 상태에서 운영 모의하는 방법과 미지의 상태에서 최적의 운영 전략을 모색하는 방법으로 구분된다. 전자의 경우, ROM (Reservoir Operation Model)이라 명명된다. ROM에는 Auto ROM (Auto Reservoir Operation Method; 자연 조절 방식), Rigid ROM (일정률-일정량 방식), Technical ROM, SRC ROM (Spillway Rule Curve ROM; 여수로 운영 곡선 방식), LDR (Linear Decision Rule) 등이 존재한다. 후자의 경우, 최적화 기법이 존재하며, 대표적으로는 선형계획법 (Linear Programming; LP), 정수계획법 (Integer Programming; IP), 동적계획법 (Dynamic Programming; DP) 등이 있다 (Jang et al., 2007b; Kang and Lee, 2015). ROM의 경우, 운영 전략이 기설정되어 있다. 그러나, 실제 저수지 운영 시에는 급변하는 수문 조건이나 환경 변화에 대한 실시간 전략 수립이 필요하다. 또한, 치수 및 이수 등 다양한 운영 목표 간 상충관계 (Trade-off)를 효과적으로 고려할 수 있어야 한다 (Chou and Wu, 2015; Liu et al., 2015). 한편, 최적화 기법은 실제 홍수 상황의 순간적인 변화가 충분히 반영되기 어려우며, ROM에 비해 많은 계산 시간이 소요되어 홍수기 실시간으로 긴박하게 적용되기에 한계가 있다 (Cheng and Chau, 2001).
강화학습 알고리즘은 사전 지식 없이도 주어진 환경과의 상호작용을 통해 학습이 가능하고, 저수지 시스템과 같이 복잡성, 비선형성, 불확실성을 다루는데 효과적이며, 시스템의 동적 변화에 적응하고 적절한 운영 기법을 생성할 수 있다 (Mahootchi et al., 2007; Wang et al., 2020). 또한, 강우 등 관측 자료를 토대로 실시간 최적화가 가능하며, 단기적인 목표 뿐만 아니라 장기적으로 다양한 운영 목적을 고려한 모형 개발이 가능하다는 장점이 있다 (Nasir and Durlofsky, 2023; Xu et al., 2021). Castelletti et al. (2010)은 트리 기반 회귀 모형 (Tree-based regression model)과 Q-Learning 강화학습 알고리즘을 토대로 저수지 운영을 최적화하는 방법을 제안한 바 있다. Madani and Hooshyar (2014)는 게임 이론 (Game theory)과 Q-Learning 강화학습 알고리즘을 결합한 방법으로 다중 저수지 시스템의 운영 최적화 연구를 수행한 바 있다. Xu et al. (2021)은 수력 발전 저수지를 대상으로 Deep Q-Networks 강화학습 알고리즘을 적용하여 저수지 최적 운영을 위한 프레임워크를 개발한 바 있다.
이 중 PPO (Proximal Policy Optimization) 알고리즘은 기존 강화학습 알고리즘들의 성능을 유지하면서도 연산 측면에서 경량화되어 성능, 계산 효율성 측면에서 우수하며 (Jang et al., 2019), 구현 측면에서도 간단하고 범용적이면서도 안정적이다 (Schulman et al., 2017). 또한 저수지 수문방류와 같이 이산적인 (Discrete) 결과를 도출하는 데에 성능이 우수하다는 장점을 가진다 (Schulman et al., 2015; Schulman et al., 2017). 따라서, 본 연구에서는 PPO 알고리즘을 홍수기 저수지 운영을 통한 수문방류 모의에 적용하였다.
본 연구의 목적은 PPO 강화학습 알고리즘을 기반으로 저수지 운영 모의 기법을 개발하고, 강우와 초기 수위 등 다양한 시나리오에 대해 모의 기법을 적용하여 홍수기 농업용 저수지 수문 방류 운영 기법을 개발하는 데에 있다.
Ⅱ. 재료 및 방법
1. 연구흐름도
본 연구에서는 PPO 강화학습 알고리즘을 기반으로 농업용 저수지 운영 모의 기법을 개발하고, 실제 방류 사례를 대상으로 적용성을 평가하였다. 연구대상지는 예당저수지로 선정하였으며, 기상자료, 지형자료, 유역특성 자료 및 저수지 특성을 구축하여 모의 기법을 적용한 수문 방류 운영을 수행하였다. Fig. 1은 본 연구의 전체적인 흐름도를 나타낸다.
저수지 운영 모의에 강화학습 알고리즘을 적용하기 위해 상태 (state), 행동 (action), 보상 (reward)을 정의하였다. 상태 변수는 강우 시점 t부터 종료 시점까지의 유입량, 강우량, 저수위, 저류량으로 설정되었다. 행동 영역은 저수지 방류량이며, 0에서 최대 방류량까지를 동일 간격으로 구분하여 총 11개의 이산값으로 정의되었다. 보상은 저류량과 방류량에 의해 결정되며, 저류량이 한계를 초과하면 페널티를 부여하고, 홍수 종료 시점에서 목표 저수위에 가까울수록 보너스가 주어지도록 설계되었다.
이와 같이 상태, 행동, 보상이 정의된 후 PPO 강화학습 알고리즘을 통해 저수지 운영 모의가 수행되었다. 학습 진행에 따라 각 상태에서의 행동에 따른 가치 함수는 업데이트되며, GAE (Generalized Advantage Estimator)를 활용해 현재 상태 및 행동의 가치를 환산하여 정책 함수를 학습한다. 방류량 결정에 따른 다음 시점의 저류량은 물수지 방정식을 통해 변화한다.
강화학습 모형 설계 이후 실제 저수지 방류 사례를 대상으로 적용성 평가를 수행하였다. 이를 위해 실제 방류 데이터를 수집한 뒤, 강화학습 모의에 적합한 사례를 선별하였다. 이후 강화학습 모형의 적절성과 적용성을 검토하여 성능을 평가하였다.
2. 연구대상지
PPO 알고리즘 기반 홍수기 농업용 저수지 운영 모의 기법을 적용하기 위해서는 저수지 방류량 등의 자료가 요구되며, 저수지에 수문 또는 비상수문을 통한 홍수기 수위 조절 기능이 존재해야 한다.
금강 권역의 예당저수지는 11련의 수문이 존재하여 홍수 발생 시에는 일정률 및 일정량 방류법에 따라 수문을 조작하고 있다. 수문 조작 시 최대 방류량은 하류의 급격한 수위 변동을 방지하기 위해 1,645 m3/s로 제한하는 등 구체적인 조작법이 명시되어 있다. 또한, 예산지사에서는 방류량 자료를 기구축하여 실측값과 PPO 알고리즘으로 예측된 저수지 방류량 운영 모의 기법 적용 결과를 비교하기에 용이하였다. 따라서, 본 연구에서는 예당저수지를 연구대상지로 선정하였다.
PPO 알고리즘을 적용하기 위하여 저수지 수위-내용적 곡선, 수위-방류량 곡선, 수문 방류량 자료, 저수지 제원 등이 필요하며, 이들 자료를 한국농어촌공사 예산지사의 자료 제공을 통해 구축하였다 (Fig. 2). 특히 수문 방류량 및 강수량 자료는 2020년 7월부터 2024년 8월까지의 기간에 대해 수집되었다. 강수량의 경우 예당저수지 상류 유역에 Thiessen망을 작도하여 지배 면적이 존재하는 천안, 보령, 부여, 서산 종관기상관측소에 대해 수집하였다.
3. PPO (Proximal Policy Optimization) 강화학습 알고리즘
홍수기 농업용 저수지 운영 정책 수립을 위한 강화학습 적용을 위하여, PPO 알고리즘을 활용하였다. PPO 알고리즘은 Kullback-Leibler divergency를 통한 제약 조건을 없애고 정책 함수 갱신 전후 비율에 대한 클리핑 (Clipping) 개념을 도입하여 정책이 갱신되는 정도를 간접적으로 제한하는 방식에 해당한다 (Schulman et al., 2017). 본 연구에서 설계된 PPO 알고리즘 기반 저수지 홍수기 방류 운영 기법은 Fig. 3과 같다.
가. 개요
강화학습 알고리즘의 주요 구성요소는 1) 환경 (Environment), 2) 에이전트 (Agent), 3) 상태 (State), 4) 행동 (Action), 5) 보상 (Reward), 6) 정책 (Policy)이 존재한다. 환경이란, 답을 찾아가기 위하여 설계되는 공간을 의미하며, 탐색의 주체인 에이전트가 상호작용 하게 된다. 에이전트는 무작위 혹은 정해진 정책에 따라 최대 보상을 받을 수 있는 행동을 취한다. 행동을 취해 환경과 상호작용함으로써 환경의 상태가 변화되며, 변화된 상태에서 다시 최대 보상을 찾을 수 있도록 에이전트가 활동하게 된다. 이러한 상태-행동-보상 체계의 루프가 계속되며 다양한 시행착오를 수행하면, 에이전트는 보상이 적은 행동은 지양하고 보상이 많은 행동을 지향하도록 학습하게 된다 (Fig. 4).
강화학습 알고리즘은 최적화 대상에 따라 가치 기반 (Value-based) 강화학습과 정책 기반 (Policy-based) 강화학습으로 구분된다. 가치 기반 강화학습의 경우 에이전트의 행동으로 인한 보상의 기댓값을 정의하는 가치 함수 (Value function)을 최적화하는 것에 해당한다. 가치함수의 최적화는 Bellman 방정식 등을 통해 최대 보상을 수령하는 방향으로 수행된다. 정책 기반 강화학습은 에이전트가 행동을 결정할 때 고려하는 정책 함수 (Policy function)에 대한 최적화가 주요 목적이다. 정책 혹은 정책함수는
와 같이 표현하며, 주어진 상태 (
)를 입력받아 신경망 매개변수 (
)를 기반으로 연산하여 행동 (
)를 출력하는 함수이다. 정책 기반 강화학습에서는 상태에 따라 선택하는 행동을 정책함수를 통해 결정하며, 이 과정을 반복하여 누적 보상을 최대화할 수 있는 방향으로 정책함수 내 신경망 매개변수를 최적화하게 된다.
신경망 매개변수 최적화는 정책 경사 기법 (Policy Gradient Method)을 통해 수행된다. 정책 경사 기법은
를 구하기 위해 경사상승 (Gradient Ascent) 방법을 이용하는 것으로, 특정 매개변수 조합 혹은 매개변수 벡터
에 대한 목적함수의 경사 (Gradient)를 산정한 후, 경사가 상승하는 방향으로
를 업데이트하는 방법이다.
목적함수는 정책함수
에 따른 행동으로 얻게 되는 보상에 대한 기댓값이며, 식 (1)과 같이 표현된다. 목적함수의 경사는 Sutton et al. (2000)이 제시한 정책 경사 정리 (Policy Gradient Theorem)에 따라 식 (2)와 같이 표현된다.
한편, 최종적으로 정책함수 내 신경망 매개변수는 식 (3)과 같이 정책 경사를 반영하여 지속적으로 업데이트되며, 이때 학습률 (learning rate,
)을 두어 정책 경사의 반영 정도를 고려할 수 있다.
정책 기반 강화학습의 경우, 정책 경사를 통해 정책함수 내 매개변수를 갱신하는 과정에서 정책이 급격하게 변화함에 따라 학습의 불안정성, 학습 속도의 저하, 이에 따른 학습 성능의 저하를 야기할 수 있다는 단점을 갖는다. 이와 같이 급격한 정책함수 갱신을 방지하기 위하여, 정책 갱신 전후로 갱신되는 범위에 제한 (Trust Region)을 두어 일정 수준 이하로 제약하는 조건을 추가한 TRPO (Trust Region Policy Optimization) 알고리즘이 고안되었다 (Schulman et al., 2015).
TRPO 알고리즘에서는 신경망 매개변수 갱신을 위한 목적함수의 경사
를 대체할 수 있는 손실함수 Loss Function
을 두었으며, Kullback-Leibler divergency 개념을 활용하여 제약 조건을 수학적으로 표현함으로써 신경망 매개변수가 일정 수준 이하로 갱신되게끔 하였다 (식 (4), (5)). 다만, TRPO 알고리즘은 환경 (State)가 변화할 때마다 최적의 제약 조건을 반영하기 위해 많은 연산을 요구하고 다양한 신경망 구조와의 호환성이 떨어진다는 단점이 존재한다.
여기서
는 advantage 함수이며,
는 정책 갱신 허용범위를 나타낸다.
이러한 단점을 보완하기 위하여 Schulman et al. (2017)은 PPO (Proximal Policy Optimization) 알고리즘을 제시하였다. PPO 알고리즘은 복잡한 계산을 요구하는 Kullback-Leibler divergency를 통한 제약 조건을 없애고 정책함수 갱신 전후 비율에 대한 클리핑 (Clipping) 개념을 손실함수에 도입하여 정책 변화 폭을 간접적으로 제한한다 (식 (11), (12)). 이에 대한 구체적인 수식 및 정책/가치 함수 구조는 [Ⅱ. 재료 및 방법 > 3. PPO 강화학습 알고리즘 > 마. 정책 (Policy) 및 가치 (Value) 함수]에 제시되었다.
나. 환경 (Environment) 및 상태 (State)
본 연구에서 강화학습의 환경, 즉 에이전트가 행동하는 공간은 홍수기의 농업용 저수지에 해당한다. 홍수기 농업용 저수지에 대해 강화학습 환경을 표현하기 위하여 물수지 방정식을 적용하였다. 홍수기 농업용 저수지는 물수지 방정식이라는 지배방정식 형태로 표현가능하다 (식 (6)). 에이전트의 행동에 따라 환경의 상태는 Timestep t에서 t+1로 변경된다.
여기서
는 시간,
는 현재 저수량,
은 다음 시간의 저수량이며,
는 강우에 따른 유입량,
는 기저유량,
는 수면 강수량이며,
는 방류량을 의미한다. 다만, 기저유량의 경우 연고별 풍수기 (6-9월) 최대유량이 발생하는 월의 일최저 유량의 평균을 채택하여 산정되었다 (MOE, 2019).
본 연구에서는 식 (6)과 같이 저수량, 유입량, 기저유량, 수면 강수량, 그리고 방류량으로 구성된 홍수기 저수지 물수지 방정식을 환경 공간으로 정의하였다. 에이전트 행동에 해당하는 Timestep t에서의 수문방류량 (
)에 대한 결과로 다음 시간의 저수량 (
)이 산정된다.
다. 에이전트 (Agent)의 행동 (Action)
행동은 강화학습 에이전트가 주어진 환경과 상태에서 취할 수 있는 선택지이다. 본 연구에서 강화학습 알고리즘에의 입력자료 (현재 저수량, 현재 유입량, 강우-유출 모형에 따라 산정된 후행 유입량, 기저유량, 수면 강수량 등)이 상태 (State)라면, 이로부터 모의하고자 하는 출력자료, 즉 강우로 인한 유입 발생 이후 대응을 위한 수문방류량 (유입 후 수문방류량)이 행동 (Action)에 해당한다.
본 연구에서는 Mahootchi et al. (2007) 및 Lee and Jung (2024)의 선행연구를 참고하여 에이전트가 행동할 수 있는 전체 경우의 수, 즉 수문방류량의 행동 공간 (Action space)을 식 (7)과 같이 정의하였다.
여기서,
는 저수지별 하류 하천에의 영향을 고려한 허용 최대 방류량 (the maximum allowable release),
은 방류 단계의 수를 의미한다.
한편, 농업용 저수지는 수위-방류능 곡선과 같이 수위에 따른 최대 방류량을 고려하여야 한다. 이에 본 연구에서는 수위-방류능 곡선을 강화학습 행동 공간에 대한 제약 조건으로 고려하여, 모형의 결과로서 물리적으로 발생 불가한 수문방류량이 산정되지 않도록 제한하였다.
라. 보상 (Reward)
보상은 강화학습 에이전트가 주어진 상태에서 선택한 행동, 그리고 행동에 따른 결과를 종합적으로 평가하는 기준이 된다. Timestep
에서의 보상 (
)은 현재 상태 (
), 현재 행동 (
), 그리고 다음 상태 (
)에 의존적이며, 식 (8)과 같이 표현 가능하다.
각 에피소드 내에서 저수지 운영 모의 결과에 대한 평가 기준은 행동 (
)에 대한 평가로서 수위별 방류능 초과 여부 (
), 방류량 변화 (
), 총 방류량 (
) 등을 두었으며, 다음 상태 (
)에 대한 평가로서 물수지 방정식에 따른 다음 저수량 혹은 수위 (
), 목표 수위 달성 여부 (
), 수위 조건에 따른 에피소드 중단 여부 (
) 등을 두었다. 6가지 평가 기준을 고려한 총 보상은 식 (9)와 같다.
연구대상지의 수위-방류능 곡선을 고려하여 현재 수위에서 방류 가능한 수준을 초과하는 경우 음의 보상을 주고 해당 에피소드의 학습을 중단 (Truncate)하도록 하여, 물리적으로 발생 불가한 수문방류량이 산정되지 않도록 하였다. 수위별 방류능 초과 여부에 대한 보상
는 Table 1과 같다.
Table 1
Reward function for evaluating release capacity by water level for each step
한편, 실제 저수지 방류 운영에서는 단계적 상승 혹은 하강하는 방식으로 수문방류가 시행되며, 이에 불필요한 방류 단계 변화가 발생하지 않도록 하였다. 단, 현재 저수량 범위를 고려하여 방류 단계 상승 혹은 하강이 더 나은 선택지인 경우에는 양의 보상을 주어 필요시 방류 단계 변화가 가능하게 하였다. 방류 단계 변화에 대한 보상
는 Table 2와 같다.
Table 2
Reward function for evaluating release change for each step
또한, 강우에 따른 유입 발생 기간 중 과다 방류하여 불필요한 저수량 손실을 막기 위해 식 (10)과 같이 총 방류량에 대한 보상
을 두었다.
여기서,
는 모든 Timestep 1-t까지 시행한 수문방류량의 합이다.
은 각 step에서 방류가 가능한 최소값의 합이다.
는 각 step에서 방류가 가능한 최대값의 합이며, 매 step에서 최대 방류량과 수위 조건에 따른 방류능 중 작은 값으로 산정하였다.
수문방류로 인해 매 step에서의 저수량 혹은 수위가 목표 수위 범위 (홍수기 제한수위~만수위)에 근접 혹은 도달하였는지에 대한 보상
은 Table 3과 같다.
Table 3
Reward function for evaluating water level for each step
| Condition | Reward function for water level |
![]() | ![]() |
![]() | ![]() |
![]() | ![]() |
* A is the storage of reservoir height** A is the storage of normal high water level*** A is the storage of restricted water level | |
강우로 인한 유입 종료 시점에 목표 수위인 홍수기 제한수위에 도달하였는지에 대한 보상
은 Table 4와 같다.
Table 4
Reward function for evaluating target water level achievement at the end of an episode
| Condition | Reward function for release capacity |
![]() | ![]() |
![]() | ![]() |
![]() | ![]() |
* A is the storage of restricted water level | |
한편, 저수지 수문방류는 수문을 통해 방류할 수 있는 최저 수위 미만, 즉 수문 최저 높이 미만에서는 불가하다. 수문방류 중에 제당고를 초과하는 상황도 발생하지 않아야 한다. 이에, 수문방류에 따른 결과로 산정된 저수지 수위가 수문 최하단 수위 미만으로 내려가는 경우와 제당고를 초과하는 경우에는 음의 보상을 주고 해당 에피소드의 학습을 중단하도록 하였다. 수위 조건에 따른 중단에 대한 보상
는 Table 5와 같다.
마. 정책 (Policy) 및 가치 (Value) 함수
정책함수와 가치함수는 각각 두 개의 은닉층을 갖는 다층 퍼셉트론 구조로 구성되었다.
정책함수는 softmax 함수를 통해 행동에 대한 범주형 확률 분포를 생성하고, 이 분포로부터 행동이 확률적으로 샘플링된다. 이후 정책 학습을 위해 해당 행동의 로그 확률
이 저장된다. 정책함수는 PPO 알고리즘의 clipped surrogate objective를 최소화하도록 식 (11)과 같이 업데이트된다. 또한, 최종적으로 정책 네트워크는 식 (12)에 해당하는 손실함수를 최소화하도록 학습된다. 정책 네트워크의 학습률은 0.001이고, Adam Optimizer를 통해 업데이트된다. 매 학습 시 epoch이 3회 수행된다.
여기서, 중요도 샘플링 비율
,
는GAE,
은 클리핑 계수이고 0.2로 설정되었다.
는 엔트로피 항에 해당하며, 에이전트의 탐색성을 향상하기 위한 장치에 해당한다. 가중치
는 0.01로 설정되었다.
가치함수는 현재 상태에 대한 기대 누적 보상을 추정하며, 정책 안정화를 위한 baseline으로 활용된다. 가치함수는 반환값
에 대해 평균제곱오차를 최소화하는 방식으로 학습된다. 손실함수는 식 (13)과 같다.
여기서, 반환값
는 Timestep t에서 예측되는 가치에 해당하며, 현재 보상 (
)에 할인율
를 곱한 상태
에서의 가치항
를 더하여 계산된다. 평균제곱오차가 작을수록, 정책함수의 업데이트가 적게 발생하게 된다.
정책의 좋고 나쁨을 평가하기 위하여 GAE가 활용된다. 정책 업데이트에 사용되는 advantage 함수는 GAE를 통해 추정되며 식 (14)와 같다.
여기서,
는 시간차 오차 (temporal difference error)로, 현재 상태 가치와 다음 상태의 보상 및 가치 예측의 차이를 의미한다. 이 오차에 할인율
와 감쇠 계수
를 적용하여 누적 advantage를 추정하면, 하나의 에피소드에서 발생하는 advantage 값을 모두 고려하여 gae를 산정할 수 있다. 이때,
는 0.95에 해당하며, 이는 policy gradient 기반 알고리즘에서 학습 안정성 및 정책 품질 사이에서 균형 잡힌 성능을 보이는 감쇠 계수 값에 해당한다.
Ⅲ. 결과 및 고찰
본 연구에서는 PPO 강화학습 알고리즘 기반 농업용 저수지 홍수기 방류 운영 기법을 실제 홍수기 방류 사례에 적용함으로써 적용성 평가를 수행하고자 한다.
1. 예당저수지 홍수기 방류 사례
지난 2023년 7월 중순에 예당저수지 인근 지역에서 이례적인 폭우가 발생하였다. 강우는 2023년 7월 14일부터 자정부터 7월 16일 오후까지 60시간 이상 지속되었고, 해당 기간 총 강우량은 342.8 mm, 최대 시강우량은 27.52 mm/hr에 육박하였다. 또한 최대 3시간 강우량은 69.8 mm/3hr, 최대 12시간 강우량은 151.3 mm/12hr로, 기상청에서는 인근 8개 시군과 7개 시군에 각각 호우경보와 호우주의보를 발효한 바 있다.
Fig. 5(a)는 해당 강우 기간 예당저수지로의 유입량을 나타낸 것이다. 유입량은 강우 시작 시점 (2023년 7월 14일 0시)에 56.6 m3/s 유입되고 있던 것을 시작으로 30시간이 경과한 시점 (2023년 7월 15일 9시)에 2,291 m3/s 최대로 유입되었다. 최대 유입 2,291 m3/s은 예당저수지 허용 최대 방류량인 1,645 m3/s의 약 1.4배 수준이며 무한천 계획홍수량인 2,528 m3/s의 약 0.9배 수준이다.
해당 강우에 대응하기 위하여 예당저수지 수문은 11련 전면 개방되었고, Fig. 5(b)와 같이 시간당 최대 방류량 2,475 m3/s로, 하류 영향을 고려한 허용 최대 방류량인 1,645 m3/s의 약 1.5배 수준, 무한천 계획홍수량인 2,528 m3/s의 약 0.98배 수준이다.
2. PPO 강화학습 알고리즘을 활용한 저수지 운영 모의 기법의 적용
PPO 기반 강화학습 알고리즘을 실제 홍수기 방류 사례에 적용하여 총 10,000개의 에피소드를 생성하고 학습을 수행하였다 (Fig. 6). 학습 초반에는 정책 파라미터의 변화에 따른 보상의 변동폭이 컸으나, 에피소드 수 증가에 따라 보상이 점진적으로 향상되고 정책의 변화 폭도 감소하는 경향을 보였다. 강화학습 알고리즘의 성능은 정책 수렴성 (policy convergence)과 학습 안정성 (policy stability)의 관점에서 평가될 수 있다 (Zhang et al., 2022). 본 연구에서 개발한 PPO 알고리즘의 경우, 1,171번째 에피소드부터는 정책의 작은 변화가 보상에 큰 영향을 미치지 않는 학습 안정성이 나타나기 시작하였으며, 1,313번째 에피소드에서는 정책 함수가 일정한 행동 전략으로 수렴하는 경향이 관찰되었다.
한편, 7,500-8,200 사이 에피소드 구간에서는 엔트로피 보상 항에 의한 정책 탐색 행동의 발생으로 인해 일시적으로 보상이 하락하는 현상이 나타났으나, PPO 특유의 clipping 기법과 GAE의 적용으로 인해 급격한 학습 붕괴 없이 다시 정책이 안정적으로 수렴하는 양상을 확인할 수 있었다.
Fig. 7과 Table 6은 강화학습의 주요 학습 단계별 (학습 안정화 전, 안정화 후, 정책 수렴 이후) 에피소드별 보상 분포와 통계 특성을 나타낸다.
Table 6
Statistical metrics for each training phase
학습 초기 단계인 안정화 이전 구간 (Pre-Stabilization, Episode 0-1170)에서는 에피소드 종료 후 보상이 -2,000 이하에서 750 사이를 오가며 급격한 진동을 보였고, 분포 형태도 명확히 드러나지 않았다. 특히 음의 리워드는 수위 조절 실패로 인해 방류가 불가능하거나, 제당고를 초과하는 수위가 발생하여 환경이 강제 종료 (truncated)된 경우로 해석된다.
이후 정책 함수가 점진적으로 학습됨에 따라 안정화 구간 (Post-Stabilization, Episode 1171-1312)으로 진입하였고, 이 시점부터는 정책 함수의 미소한 변동이 보상 값의 급격한 변화를 유발하지 않는 특성을 보이기 시작하였다. 보상은 636-698 구간에 집중되며 우측으로 치우친 분포를 나타냈고, 표준편차는 961.96에서 244.87로 감소, 왜도의 절댓값은 1.01에서 5.81로 증가하였다. 이는 보상 범위가 고보상 영역으로 편향되며 분포가 뾰족해졌음을 시사한다.
정책 수렴 이후 (Post-Convergence, Episode 1313 이상)에는 보상 값이 713까지 도달하였으며, 최고 보상 범위 구간 (650–713)에서의 빈도수가 압도적으로 증가하였다. 이로 인해 평균 reward는 581.11로 상승하고, 표준편차는 143.07로 줄어들었으며, 왜도는 2.19로 완화되어 보상 값의 분포가 안정화 구간에 비해 정규적인 형태로 안정화되었음을 확인할 수 있다.
Pre-Stabilization 구간에서는 평균 -335.71, 표준편차 961.96, 왜도 -1.01의 특성을 보였으며, Post-Stabilization 구간에서는 평균 505.14, 표준편차 244.87, 왜도 -5.81로 보상이 고보상 구간에 집중되기 시작하였다. 이후 Post-Convergence 구간에서는 평균 581.11, 표준편차 143.07, 왜도 –2.19로 보상이 비교적 수렴된 분포에 정착하여, 일관되고 안정적인 정책이 형성되었음을 확인할 수 있었다. 강화학습 기반 저수지 운영 모의 기법의 구현 성능을 종합적으로 분석한 결과, 해당 강화학습 알고리즘은 충분한 수렴 특성을 확보한 것으로 판단되었으며, 이에 따라 학습된 정책을 실제 저수지 운영 시나리오에 적용하였다.
3. PPO 강화학습 알고리즘을 활용한 저수지 운영 모의 기법 적용 결과
본 연구에서는 (1) 실제 방류 사례에서 시행한 최대 방류량 (2,475 m3/s)을 고려하여 무한천 계획홍수량인 2,528 m3/s을 강화학습 알고리즘 내 가능 최대 방류량으로 적용하여 저수지 운영 모의 기법의 적용성을 평가하는 한편, (2) 예당저수지의 허용 최대 방류량인 1,645 m3/s을 가능 최대 방류량으로 적용하여 하류 하천에 영향이 없는 범위 내에서 방류가 가능했는지 사후 분석을 수행하였다.
가. 무한천 계획홍수량 (2,528 m3/s)을 최대 방류량으로 설정한 경우
2023년 7월 발생한 강우사상에 대응하기 위하여 예당저수지는 수문 11련 전면 개방하고 최대 2,475 m3/s 방류를 시행한 바 있다. 이는 예당저수지 지점에서의 무한천 계획홍수량인 2,528 m3/s에 근접한 수준이다. Table 7은 실측 방류량과 모의 방류량 간의 방류량, 방류기간, 수위 등을 비교한 것이다. 모의 결과, 실제 방류 사례에 비해 총 방류량은 약 0.9% (1,786.7 103m3) 정도 적었으며, 총 방류시간 또한 7시간 짧았다. 최대 방류량은 10% (247.5 m3/s) 적었고, 최대 방류를 지속하는 시간은 동일하게 7시간으로 나타났다. 최고 수위는 실제 방류 사례에서 22.52 EL.m, 모의 방류 시 22.48 EL.m로 소폭 낮게 나타났고, 최저 수위는 초기 수위인 20.70 EL.m로 동일하게 나타났다. 유입 종료시점에서의 수위는 실제 방류 사례에서 21.48 EL.m, 모의 방류 시 21.53 m로 예당저수지의 홍수기 제한수위인 21.5 EL.m와 근사한 결과를 보였다.
Table 7
Comparison of observed and simulated release cases (maximum release of 2,475 m3/s)
Fig. 8은 강화학습 알고리즘 내 에이전트가 행동을 선택할 수 있는 최대 방류량을 실제 방류 사례에서와 같이 예당저수지 지점에서의 무한천 계획홍수량 (2,528 m3/s)에 근접한 수준인 2,475 m3/s로 두고 모의한 결과와 실측 방류를 나타낸 것이다.
나. 허용 최대 방류량 (1,645 m3/s)을 최대 방류량으로 설정한 경우
2023년 7월 발생한 강우에 대응하기 위하여 실제 방류 사례에서 시행한 최대 방류량 (2,475 m3/s), 그리고 무한천 계획홍수량 (2,528 m3/s)가 아닌, 예당저수지의 허용 최대 방류량 (1,645 m3/s)을 강화학습 알고리즘 내 에이전트가 행동을 선택할 수 있는 최대 방류량으로 적용하여 잠재적으로 하류 하천에 영향을 미치지 않을 수 있도록 하고, 방류 단계는 총 50단계로 균등하게 나누어 모의하였다. Table 8은 실측 방류량과 모의 방류량 간의 방류량, 방류기간, 수위 등을 비교한 것이다. 모의 결과, 실제 방류 사례에 비해 총 방류량은 약 2.7% (5,180.4 103m3) 정도 적었으며, 총 방류시간 또한 6시간 짧았다. 최대 방류량은 약 33.5% (830 m3/s) 적었던 반면, 최대 방류를 15시간 동안 지속하여 실제 방류 사례 (7시간)에 비해 긴 것으로 나타났다. 최고 수위는 실제 방류 사례에서 22.52 EL.m, 모의 방류 시 23.37 EL.m로 높게 나타났고, 최저 수위는 초기 수위인 20.70 EL.m로 동일하게 나타났다. 유입 종료시점에서의 수위는 실제 방류 사례에서 21.48 EL.m, 모의 방류 시 21.73 EL.m로 소폭 높아, 예당저수지의 홍수기 제한수위인 21.5 EL.m보다는 높은 결과를 보였다.
Table 8
Comparison of observed and simulated release cases (maximum release of 1,645 m3/s)
Fig. 9는 실측 방류 (최대 2,475 m3/s)와 모의 방류 (최대 1,645 m3/s)가 이루어졌을 때, 예당저수지 수위 변화를 나타낸 것이다. 허용 최대 방류량 이하로 방류를 진행하더라도 기 발생한 강우에 충분히 대응이 가능할 수 있었을 것으로 보인다.
Ⅳ. 요약 및 결론
본 연구에서는 PPO 강화학습 알고리즘을 기반으로 저수지 운영 모의 기법을 개발하고, 2023년 7월 발생한 예당저수지 홍수기 운영 사례를 대상으로 강화학습 기반 모의 운영 기법을 적용하여 최적의 수문 방류 곡선을 제안하였다.
실제 사례에서 예당저수지의 최대 방류량은 2,475 m3/s로 운영된 바 있다. 이를 강화학습이 선택할 수 있는 허용 최대 방류량으로 설정하여 모의를 수행한 결과, 실제 사례에 대비 총 방류량은 약 0.9% (1,786.7 103m3) 감소하였으며, 최대 방류량은 10% (247.5 m3/s) 낮게 나타났다. 강우 중 최저 수위와 최고 수위는 실제 사례와 모의 결과에서 유사한 수준으로 나타났다. 유입 종료 시점의 최종 수위는 실제 사례에서 21.23 EL.m, 모의 결과에서 21.69 EL.m로 모두 홍수기 제한수위 허용범위 내로 나타났다.
한편, 예당저수지는 하류 하천에 영향이 없는 범위 내에서 방류를 허용하고 있으며, 이때 허용 최대 방류량은 1,645 m3/s이다. 이를 강화학습이 선택할 수 있는 허용 최대 방류량으로 설정하여 모의한 결과, 실제 사례 대비 총 방류량 및 최대 방류량은 각각 2.7% (5180.4 103m3), 33.5% (830 m3/s) 감소하였다. 반면, 최대 방류량 지속시간은 모의 결과에서 15시간으로 실제 사례 (7시간)에 비해 길게 유지되었다. 유입 종료 시점의 최종 수위는 실제 사례에서 21.23 EL.m, 모의 결과에서 21.63 EL.m로 홍수기 제한수위인 21.5 EL.m에 근접하였다. 해당 결과에 따르면, 강화학습 기반 운영을 통해 실제 사례에서 시행된 최대 방류량 2,475 m3/s보다 낮은 허용 최대 방류량 (1,645 m3/s)을 적용하여 호우에 대응할 수 있음을 시사한다.
모의 결과를 종합하면, 강화학습 기반 저수지 운영 모의에서는 총 방류량과 최대 방류량이 실제 사례보다 감소하는 경향을 보였으며, 이는 하류 하천의 침수 피해 위험 완화 가능성을 시사한다. 또한 홍수기 이후 저수지 내 저수량이 실제 사례보다 높은 수준으로 유지되는 것으로 나타나, 비홍수기 농업용수 공급 측면에서도 기존 운영 대비 저수지 용수 공급 능력을 향상할 수 있을 것으로 판단된다.
향후 대상 저수지 유역에서 강우 대응을 위한 방류 운영 자료, 강우량-첨두유입량-수위 조견표, 개문 수와 개도 높이에 따른 수위별 방류량 자료 등 수문 운영 현황 및 참고 자료에 대한 검토를 통해 강화학습 모델을 설계함으로써 실제 현장을 반영할 수 있도록 추가 연구가 필요하다. 또한, 단기 동네예보 및 초단기 레이더 예보 강우 자료 등 다양한 자료를 대상으로 추가적인 분석을 진행한다면 강우 예보 시 수문방류를 통해 강우 유입 전까지 낮춰야 할 초기 수위에 대한 제시, 최대 방류량 및 방류 지속시간에 대한 제시 등 보다 다각적이고 체계적인 수문방류 가이드라인 마련이 가능할 것으로 기대된다.









is the release capacity for each water level of reservoir with fully opening the gate
exceeds
, the episode is truncated to prevent learning that episode case















is the storage of normal high water level
is the final maximum allowable release determined by the smaller value of a) the maximum allowable release and b) the release capacity for each water level of reservoir with fully opening the gate





is the storage of reservoir height
is the storage of normal high water level
is the storage of restricted water level





is the storage of restricted water level




is the storage of reservoir height
is the storage at the bottom of a sluice gate




