바둑의 보상은 종국의 승패, 단 한 번입니다. 수백 수를 두는 동안 어느 수가 좋은 수였는지 아무도 말해주지 않습니다. 대국을 재생하고, 승리의 크레딧이 마지막 수에서 첫 수까지 황금빛으로 거슬러 올라가는 것을 보세요. 거슬러 올라온 그 몫이 곧 각 수의 가치, 이 수에서 내다본 미래입니다.
지금 γ에서 첫 수가 인정받는 몫: 17%
돌이 놓이는 동안 보상은 계속 0입니다. 종국에 흑이 이기면 +1이 단 한 번 도착합니다. 되감기의 금빛은 각 수가 인정받는 승리의 몫(%)입니다. 승리에서 먼 수일수록 할인되어 도착합니다.
축구는 골을 기록하고 어시스트까지 기록합니다. 하지만 그 앞의 세 번째 패스는 기록되지 않죠. 바둑은 더 심합니다. 150수를 두고 승리는 한 번. 그 승리가 어느 수 덕분인지 아무도 말해주지 않습니다. 지나간 행동들에게 결과의 공을 나눠주는 문제, 강화학습은 이것을 크레딧 할당이라 부릅니다. 답은 할인입니다. 마지막 수는 승리를 거의 그대로, 첫 수는 γ를 35번 곱한 만큼 할인받아 받습니다.
γ를 0.70으로 내려보세요. 금빛이 마지막 몇 수에서 끊깁니다. 눈앞의 보상만 보는 삶입니다. γ를 0.99로 올리면 첫 수도 승리의 70%를 인정받습니다. 사람마다 인생의 γ가 있습니다. 당신의 첫 수는, 아직 크레딧이 도착하지 않았을 뿐입니다.
되감기로 채운 가치 막대를 다시 보세요. 끝까지 두어 보지 않아도 지금 이 판이 얼마나 승리에 가까운지 알려 줍니다. 알파고에는 이 일을 하는 두뇌, 가치망이 따로 있었습니다. 자기 자신과 둔 대국 3,000만 판에서 뽑은 국면으로 「이 판에서 이길 확률」을 배웠고, 그래서 수백 수 뒤의 승패를 지금 판 위에서 내다봤습니다. 몬테주마의 가치 지도가 보물에서 입구로 번지던 것도 같은 일입니다.