# Opt in with chat_template_args.enable_thinking=true. Baseten documents no # explicit false behavior, effort values, or reasoning-token budget. # https://docs.baseten.co/inference/model-apis/reasoning base_model = "zhipuai/glm-5.1" name = "GLM 5.1" [[reasoning_options]] type = "toggle" [interleaved] field = "reasoning_content" [cost] input = 1.3 output = 4.3 cache_read = 0.26 [limit] context = 202_800 output = 202_800