22 lines
745 B
Python
22 lines
745 B
Python
""" AlphaGo 的价值网络部分,用于评估棋盘状态的价值,即估算当前的局面走某步棋后的胜率 """
|
|
# from tugo.models.alphago import alphago_model
|
|
from tugo.models.alphago import AlphaGoModel
|
|
from tugo.encoders.alphago import AlphaGoEncoder
|
|
from tugo.rl.value import ValueAgent
|
|
from tugo.rl.experience import ExperienceBuffer
|
|
|
|
# init_value
|
|
rows, cols = 19, 19
|
|
encoder = AlphaGoEncoder()
|
|
input_shape = (encoder.num_planes, rows, cols)
|
|
alphago_value_network = AlphaGoModel(input_shape)
|
|
|
|
alphago_value = ValueAgent(alphago_value_network, encoder)
|
|
|
|
# train_value
|
|
experience = ExperienceBuffer.load('checkpoints/alphago_rl_experience.h5')
|
|
|
|
alphago_value.train(experience)
|
|
|
|
alphago_value.save('checkpoints/alphago_value.h5')
|