@@ -252,10 +252,6 @@ def permute(v: Tensor, n_heads: int):
252252253253return sd
254254255-def fix_bf16(weights:dict[Any, Tensor]):
256-# TODO: without casting to float16, 70B llama OOM on tinybox.
257-return {k:v.cast(dtypes.float32).cast(dtypes.float16) if v.dtype == dtypes.bfloat16 else v for k,v in weights.items()}
258-259255class Tokenizer:
260256pat_str = r"(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\r\n\p{L}\p{N}]?\p{L}+|\p{N}{1,3}| ?[^\s\p{L}\p{N}]+[\r\n]*|\s*[\r\n]+|\s+(?!\S)|\s+"
261257def __init__(self, model_path: str):
@@ -325,7 +321,6 @@ def build_transformer(model_path: Path, model_size="8B", scale_dtype=dtypes.floa
325321# load weights
326322weights = load(str(model_path / "model.safetensors"))
327323weights = convert_from_huggingface(weights, MODEL_PARAMS[model_size]["args"]["n_layers"], MODEL_PARAMS[model_size]["args"]["n_heads"], MODEL_PARAMS[model_size]["args"]["n_kv_heads"])
328-weights = fix_bf16(weights)
329324330325with Context(BEAM=0):
331326# shard