Connect AI LAB · 강화학습 인문학 실습 ② 가치 — 미래를 내다보는 힘

알파고의 크레딧

바둑의 보상은 종국의 승패, 단 한 번입니다. 수백 수를 두는 동안 어느 수가 좋은 수였는지 아무도 말해주지 않습니다. 대국을 재생하고, 승리의 크레딧이 마지막 수에서 첫 수까지 황금빛으로 거슬러 올라가는 것을 보세요. 거슬러 올라온 그 몫이 곧 각 수의 가치, 이 수에서 내다본 미래입니다.

0 / 36수 이번 수의 보상 0
▶ 대국 재생을 누르세요. 보상 칸에서 눈을 떼지 마시고요.
각 수의 가치 = 이 수에서 내다본 승리 (미래 예측)되감기 전에는 모든 수의 가치가 0입니다
첫 수마지막 수 → 승리 +1

진행

0.95

지금 γ에서 첫 수가 인정받는 몫: 17%

읽는 법

돌이 놓이는 동안 보상은 계속 0입니다. 종국에 흑이 이기면 +1이 단 한 번 도착합니다. 되감기의 금빛은 각 수가 인정받는 승리의 몫(%)입니다. 승리에서 먼 수일수록 할인되어 도착합니다.

문제

승리는 한 번, 수는 150개

축구는 골을 기록하고 어시스트까지 기록합니다. 하지만 그 앞의 세 번째 패스는 기록되지 않죠. 바둑은 더 심합니다. 150수를 두고 승리는 한 번. 그 승리가 어느 수 덕분인지 아무도 말해주지 않습니다. 지나간 행동들에게 결과의 공을 나눠주는 문제, 강화학습은 이것을 크레딧 할당이라 부릅니다. 답은 할인입니다. 마지막 수는 승리를 거의 그대로, 첫 수는 γ를 35번 곱한 만큼 할인받아 받습니다.

인생 번역

초기의 노력이 제일 늦게 인정받는다

γ를 0.70으로 내려보세요. 금빛이 마지막 몇 수에서 끊깁니다. 눈앞의 보상만 보는 삶입니다. γ를 0.99로 올리면 첫 수도 승리의 70%를 인정받습니다. 사람마다 인생의 γ가 있습니다. 당신의 첫 수는, 아직 크레딧이 도착하지 않았을 뿐입니다.

알파고의 눈

가치 = 미래를 내다보는 힘

되감기로 채운 가치 막대를 다시 보세요. 끝까지 두어 보지 않아도 지금 이 판이 얼마나 승리에 가까운지 알려 줍니다. 알파고에는 이 일을 하는 두뇌, 가치망이 따로 있었습니다. 자기 자신과 둔 대국 3,000만 판에서 뽑은 국면으로 「이 판에서 이길 확률」을 배웠고, 그래서 수백 수 뒤의 승패를 지금 판 위에서 내다봤습니다. 몬테주마의 가치 지도가 보물에서 입구로 번지던 것도 같은 일입니다.

보상이 늦는 것과 없는 것은 다르다.