diff --git a/evalharness/model/adapter.py b/evalharness/model/adapter.py index feebd20..44cbc75 100644 --- a/evalharness/model/adapter.py +++ b/evalharness/model/adapter.py @@ -205,7 +205,8 @@ class OpenAICompatible(ModelAdapter): if stream: out = await self._post_stream_perf( f'{self.api_base}/chat/completions', payload, headers, t0) - elif int(payload.get('max_tokens') or 0) > 8192: + elif int(payload.get('max_tokens') or 0) > 100000 \ + and not os.environ.get('EVALHARNESS_NO_AUTOSTREAM'): # long generation: stream and aggregate (gateway-safe). # Some gateways drop chat_template_kwargs on the STREAM # path only (non-stream honors it) -- append the /no_think