For the complete documentation index, see llms.txt. Markdown versions of all pages are available by appending .md to any URL (e.g. /max/get-started.md).
Python module
max.pipelines.architectures.pixtral
Pixtral vision-language architecture for multimodal text generation.
PixtralConfigβ
class max.pipelines.architectures.pixtral.PixtralConfig(*, dtype, devices, image_token_index, hidden_size, num_attention_heads, rms_norm_eps, rope_theta, max_seq_len, num_hidden_layers, head_dim, num_key_value_heads, feed_forward_length, vocab_size, kv_params, attention_multiplier, patch_size, image_size, num_channels, vision_hidden_size, vision_num_attention_heads, vision_rope_theta, vision_num_hidden_layers, vision_intermediate_size, vision_head_dim, return_logits=ReturnLogits.LAST_TOKEN)
Bases: ArchVLConfigWithTextSubconfig, ArchConfigWithStoredKVParams, ArchConfigWithKVCache
Configuration for Pixtral models.
-
Parameters:
-
- dtype (DType)
- devices (list[DeviceRef])
- image_token_index (int)
- hidden_size (int)
- num_attention_heads (int)
- rms_norm_eps (float)
- rope_theta (float)
- max_seq_len (int)
- num_hidden_layers (int)
- head_dim (int)
- num_key_value_heads (int)
- feed_forward_length (int)
- vocab_size (int)
- kv_params (KVCacheParams)
- attention_multiplier (float)
- patch_size (int)
- image_size (int)
- num_channels (int)
- vision_hidden_size (int)
- vision_num_attention_heads (int)
- vision_rope_theta (float)
- vision_num_hidden_layers (int)
- vision_intermediate_size (int)
- vision_head_dim (int)
- return_logits (ReturnLogits)
attention_multiplierβ
attention_multiplier: float
calculate_max_seq_len()β
classmethod calculate_max_seq_len(pipeline_config, huggingface_config, model_config=None)
Delegates to the annotated text config class.
-
Parameters:
-
- pipeline_config (PipelineConfig)
- huggingface_config (AutoConfig)
- model_config (MAXModelConfig | None)
-
Return type:
devicesβ
dtypeβ
dtype: DType
feed_forward_lengthβ
feed_forward_length: int
get_num_layers()β
static get_num_layers(huggingface_config)
Layer count for the decoder stack (override when HF uses a different field).
-
Parameters:
-
huggingface_config (AutoConfig)
-
Return type:
head_dimβ
head_dim: int
hidden_sizeβ
hidden_size: int
image_sizeβ
image_size: int
image_token_indexβ
image_token_index: int
initialize()β
classmethod initialize(pipeline_config, model_config=None)
Initializes a PixtralConfig instance from pipeline configuration.
This method creates a config instance with all fields that can be determined from the pipeline configuration.
-
Parameters:
-
- pipeline_config (PipelineConfig) β The MAX Engine pipeline configuration.
- model_config (MAXModelConfig | None)
-
Returns:
-
An initialized PixtralConfig instance.
-
Return type:
kv_paramsβ
kv_params: KVCacheParams
max_seq_lenβ
max_seq_len: int
num_attention_headsβ
num_attention_heads: int
num_channelsβ
num_channels: int
num_hidden_layersβ
num_hidden_layers: int
num_key_value_headsβ
num_key_value_heads: int
patch_sizeβ
patch_size: int
return_logitsβ
return_logits: ReturnLogits = 'last_token'
Whether to return the last token, all logits, or a variable number of logits.
rms_norm_epsβ
rms_norm_eps: float
rope_thetaβ
rope_theta: float
vision_head_dimβ
vision_head_dim: int
vision_hidden_sizeβ
vision_hidden_size: int
vision_intermediate_sizeβ
vision_intermediate_size: int
vision_num_attention_headsβ
vision_num_attention_heads: int
vision_num_hidden_layersβ
vision_num_hidden_layers: int
vision_rope_thetaβ
vision_rope_theta: float
vocab_sizeβ
vocab_size: int
PixtralInputsβ
class max.pipelines.architectures.pixtral.PixtralInputs(tokens, input_row_offsets, return_n_logits, pixel_patches=None, vision_attention_mask=None, vision_position_ids=None, image_token_indices=None, *, kv_cache_inputs=None, lora=None, hidden_states=None)
Bases: ModelInputs
Holds inputs for the Pixtral model.
-
Parameters:
-
- tokens (Buffer)
- input_row_offsets (Buffer)
- return_n_logits (Buffer)
- pixel_patches (Buffer | None)
- vision_attention_mask (Buffer | None)
- vision_position_ids (Buffer | None)
- image_token_indices (Buffer | None)
- kv_cache_inputs (KVCacheInputsInterface[Buffer, Buffer] | None)
- lora (LoRAInputs | None)
- hidden_states (Buffer | list[Buffer] | None)
has_vision_inputsβ
property has_vision_inputs: bool
image_token_indicesβ
input_row_offsetsβ
input_row_offsets: Buffer
pixel_patchesβ
return_n_logitsβ
return_n_logits: Buffer
tokensβ
tokens: Buffer
vision_attention_maskβ
vision_position_idsβ
PixtralModelβ
class max.pipelines.architectures.pixtral.PixtralModel(pipeline_config, session, devices, kv_cache_config, weights, adapter=None, return_logits=ReturnLogits.LAST_TOKEN, max_batch_size=1)
Bases: MultiGraphPipelineModelWithKVCache[TextAndVisionContext]
Pixtral pipeline model with separate vision and language graphs.
-
Parameters:
-
- pipeline_config (PipelineConfig)
- session (InferenceSession)
- devices (list[Device])
- kv_cache_config (KVCacheConfig)
- weights (Weights)
- adapter (WeightsAdapter | None)
- return_logits (ReturnLogits)
- max_batch_size (int)
batch_processor_clsβ
batch_processor_cls
alias of PixtralBatchProcessor
calculate_max_seq_len()β
classmethod calculate_max_seq_len(pipeline_config, huggingface_config)
Bounds max_length by text_config.max_position_embeddings (config is permissive).
-
Parameters:
-
- pipeline_config (PipelineConfig)
- huggingface_config (AutoConfig)
-
Return type:
execute()β
execute(model_inputs)
Executes the graph with the given inputs.
-
Parameters:
-
model_inputs (ModelInputs) β The model inputs to execute, containing tensors and any other required data for model execution.
-
Returns:
-
ModelOutputs containing the pipelineβs output tensors.
-
Return type:
This is an abstract method that must be implemented by concrete PipelineModels to define their specific execution logic.
language_modelβ
language_model: Model
model_config_clsβ
model_config_cls
alias of PixtralConfig
vision_modelβ
Was this page helpful?
Thank you! We'll create more content like this.
Thank you for helping us improve!