MindSpore Transformers

Introduction

  • Quick Start
  • Overall Structure
  • Model Support Library

Installation

  • Installation Guide

Training Guide

  • Training Guide

Function Features

  • Function Overview
  • Starting Tasks
  • Configuration File Description
  • Logs
  • Datasets
  • Hyperparameters and Optimizers for Training
  • Distributed Parallel Training
  • Training Graphics Memory Optimization
  • Weight Saving and Loading
  • Resumable Training
  • Training Metric Monitoring and Profiling
  • Other Training Features
  • Static Graph Features

Environment Variables

  • Environment Variables

Contribution Guide

  • MindSpore Transformers Contribution Guidelines
  • Modelers Contribution Guidelines

FAQ

  • Model-Related FAQ
  • Feature-Related FAQ

Static Graph Implementation (Deprecated)

  • Overall Structure
  • Full-process Guide to Large Models
  • Features
    • Features Overview
    • Start Tasks
    • Ckpt Weights
    • Safetensors Weights
    • Configuration File Descriptions
    • Loading Hugging Face Model Configuration
    • Logs
    • Using Tokenizer
    • Dataset
    • Training Hyperparameters
    • Training Metrics Monitoring
    • Resumable Training After Breakpoint
    • Checkpoint Saving and Loading
    • Resume Training2.0
    • Distributed Parallelism Training
    • Training High Availability
    • Memory Optimization
    • Data Skip And Checkpoint Health Monitor
    • Pre-trained Model Average Weight Consolidation
    • Other Training Features
    • Quantization
  • Advanced Development
  • Excellent Practice
  • Environment Variable Descriptions
MindSpore Transformers
  • »
  • Features
  • View page source

Features

  • Features Overview
  • Start Tasks
  • Ckpt Weights
  • Safetensors Weights
  • Configuration File Descriptions
  • Loading Hugging Face Model Configuration
  • Logs
  • Using Tokenizer
  • Dataset
  • Training Hyperparameters
  • Training Metrics Monitoring
  • Resumable Training After Breakpoint
  • Checkpoint Saving and Loading
  • Resume Training2.0
  • Distributed Parallelism Training
  • Training High Availability
  • Memory Optimization
  • Data Skip And Checkpoint Health Monitor
  • Pre-trained Model Average Weight Consolidation
  • Other Training Features
  • Quantization
Previous Next

© Copyright MindSpore.

Built with Sphinx using a theme provided by Read the Docs.