GitHub

@@ -252,10 +252,6 @@ def permute(v: Tensor, n_heads: int):

252252253253

return sd

254254255-

def fix_bf16(weights:dict[Any, Tensor]):

256-

# TODO: without casting to float16, 70B llama OOM on tinybox.

257-

return {k:v.cast(dtypes.float32).cast(dtypes.float16) if v.dtype == dtypes.bfloat16 else v for k,v in weights.items()}

258-259255

class Tokenizer:

260256

pat_str = r"(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\r\n\p{L}\p{N}]?\p{L}+|\p{N}{1,3}| ?[^\s\p{L}\p{N}]+[\r\n]*|\s*[\r\n]+|\s+(?!\S)|\s+"

261257

def __init__(self, model_path: str):

@@ -325,7 +321,6 @@ def build_transformer(model_path: Path, model_size="8B", scale_dtype=dtypes.floa

325321

# load weights

326322

weights = load(str(model_path / "model.safetensors"))

327323

weights = convert_from_huggingface(weights, MODEL_PARAMS[model_size]["args"]["n_layers"], MODEL_PARAMS[model_size]["args"]["n_heads"], MODEL_PARAMS[model_size]["args"]["n_kv_heads"])

328-

weights = fix_bf16(weights)

329324330325

with Context(BEAM=0):

331326

# shard

Read the original on github.com ↗