GitHub

Original file line numberDiff line numberDiff line change

@@ -4,7 +4,7 @@ jupytext:

44

extension: .md

55

format_name: myst

66

format_version: 0.13

7-

jupytext_version: 1.14.5

7+

jupytext_version: 1.16.7

88

kernelspec:

99

display_name: Python 3 (ipykernel)

1010

language: python

@@ -996,7 +996,7 @@ def evaluate_policy(θ, F):

996996

x0 = np.array([[1.], [0.], [0.]])

997997

value = - x0.T @ P_F @ x0 - d_F

998998

entropy = x0.T @ O_F @ x0 + o_F

999-

return list(map(float, (value, entropy)))

999+

return list(map(float, (value.item(), entropy.item())))

10001000
10011001
10021002

def value_and_entropy(emax, F, bw, grid_size=1000):

Read the original on github.com ↗