For the complete documentation index, see llms.txt. Markdown versions of all pages are available by appending .md to any URL (e.g. /max/get-started.md).
Python class
PipelineRuntimeConfig
PipelineRuntimeConfigβ
class max.pipelines.lib.PipelineRuntimeConfig(*, config_file=None, section_name=None, pipeline_role='prefill_and_decode', max_batch_size=None, max_queue_size_tg=None, min_batch_size_tg=None, ep_size=1, ep_use_allreduce=False, eplb_profile=<factory>, ce_delay_ms=0.0, enable_prioritize_first_decode=False, enable_chunked_prefill=True, chunked_prefill_min_chunk_size=0, enable_in_flight_batching=False, eplb_replicas_per_gpu=0, max_num_steps=1, max_batch_input_tokens=8192, use_experimental_kernels='false', use_vendor_blas='false', use_vendor_ccl='false', custom_architectures=<factory>, execute_empty_batches=False, max_batch_total_tokens=None, device_graph_capture=None, fold_sampler_into_graph=True, force=False, max_pending_futures=1, kvcache_ce_watermark=0.95, decode_stall_timeout_s=None, decode_request_ttl_s=None, enable_overlap_scheduler=False, dp_ce_balance_timeout_ms=-1.0, dp_ce_balance_threshold=0.8, dp_ce_balance_enable_dynamic_chunk_size=True, allow_unsupported_logprobs=False, allow_extra_request_fields=False, prefer_module_v3=False, reasoning_parser=None, tool_parser=None, emit_reasoning_content=False, temperature=None, top_k=None, thinking_temperature=None, max_vision_cache_entries=256, denoising_cache=<factory>)
Bases: ConfigFileModel
Model-agnostic runtime settings for pipeline execution.
Contains batching, scheduling, and execution configuration that is independent of any particular model architecture.
-
Parameters:
-
- config_file (str | None)
- section_name (str | None)
- pipeline_role (Literal['prefill_and_decode', 'prefill_only', 'decode_only'])
- max_batch_size (int | None)
- max_queue_size_tg (int | None)
- min_batch_size_tg (int | None)
- ep_size (int)
- ep_use_allreduce (bool)
- eplb_profile (bool)
- ce_delay_ms (float)
- enable_prioritize_first_decode (bool)
- enable_chunked_prefill (bool)
- chunked_prefill_min_chunk_size (int)
- enable_in_flight_batching (bool)
- eplb_replicas_per_gpu (int)
- max_num_steps (int)
- max_batch_input_tokens (int)
- use_experimental_kernels (str)
- use_vendor_blas (str)
- use_vendor_ccl (str)
- custom_architectures (list[str])
- execute_empty_batches (bool)
- max_batch_total_tokens (int | None)
- device_graph_capture (bool | None)
- fold_sampler_into_graph (bool)
- force (bool)
- max_pending_futures (int)
- kvcache_ce_watermark (float)
- decode_stall_timeout_s (float | None)
- decode_request_ttl_s (float | None)
- enable_overlap_scheduler (bool)
- dp_ce_balance_timeout_ms (float)
- dp_ce_balance_threshold (float)
- dp_ce_balance_enable_dynamic_chunk_size (bool)
- allow_unsupported_logprobs (bool)
- allow_extra_request_fields (bool)
- prefer_module_v3 (bool)
- reasoning_parser (str | None)
- tool_parser (str | None)
- emit_reasoning_content (bool)
- temperature (float | None)
- top_k (int | None)
- thinking_temperature (float | None)
- max_vision_cache_entries (int)
- denoising_cache (DenoisingCacheConfig)
allow_extra_request_fieldsβ
allow_extra_request_fields: bool
allow_unsupported_logprobsβ
allow_unsupported_logprobs: bool
ce_delay_msβ
ce_delay_ms: float
chunked_prefill_min_chunk_sizeβ
chunked_prefill_min_chunk_size: int
Minimum tokens in any chunk created by chunked prefill (0 = off).
custom_architecturesβ
decode_request_ttl_sβ
decode_stall_timeout_sβ
denoising_cacheβ
denoising_cache: DenoisingCacheConfig
device_graph_captureβ
dp_ce_balance_enable_dynamic_chunk_sizeβ
dp_ce_balance_enable_dynamic_chunk_size: bool
Whether below-threshold CE steps run at a reduced chunk size.
dp_ce_balance_thresholdβ
dp_ce_balance_threshold: float
Occupancy threshold (0-1) that schedules CE work without deferral.
dp_ce_balance_timeout_msβ
dp_ce_balance_timeout_ms: float
Deferral deadline for DP-balanced CE scheduling (-1 = disabled).
emit_reasoning_contentβ
emit_reasoning_content: bool
enable_chunked_prefillβ
enable_chunked_prefill: bool
enable_in_flight_batchingβ
enable_in_flight_batching: bool
enable_overlap_schedulerβ
enable_overlap_scheduler: bool
enable_prioritize_first_decodeβ
enable_prioritize_first_decode: bool
ep_sizeβ
ep_size: int
ep_use_allreduceβ
ep_use_allreduce: bool
eplb_profileβ
eplb_profile: bool
eplb_replicas_per_gpuβ
eplb_replicas_per_gpu: int
execute_empty_batchesβ
execute_empty_batches: bool
fold_sampler_into_graphβ
fold_sampler_into_graph: bool
forceβ
force: bool
kvcache_ce_watermarkβ
kvcache_ce_watermark: float
max_batch_input_tokensβ
max_batch_input_tokens: int
max_batch_sizeβ
max_batch_total_tokensβ
max_num_stepsβ
max_num_steps: int
max_pending_futuresβ
max_pending_futures: int
max_queue_size_tgβ
max_vision_cache_entriesβ
max_vision_cache_entries: int
min_batch_size_tgβ
model_configβ
model_config: ClassVar[ConfigDict] = {'extra': 'forbid', 'strict': False}
Configuration for the model, should be a dictionary conforming to [ConfigDict][pydantic.config.ConfigDict].
model_post_init()β
model_post_init(context, /)
This function is meant to behave like a BaseModel method to initialise private attributes.
It takes context as an argument since thatβs what pydantic-core passes when calling it.
-
Parameters:
-
- self (BaseModel) β The BaseModel instance.
- context (Any) β The context.
-
Return type:
-
None
pipeline_roleβ
pipeline_role: PipelineRole
prefer_module_v3β
prefer_module_v3: bool
reasoning_parserβ
temperatureβ
thinking_temperatureβ
tool_parserβ
top_kβ
use_experimental_kernelsβ
use_experimental_kernels: str
use_vendor_blasβ
use_vendor_blas: str
use_vendor_cclβ
use_vendor_ccl: str
Was this page helpful?
Thank you! We'll create more content like this.
Thank you for helping us improve!