Hugging Face

Latest AI news, models and releases from Hugging Face. ['Diffusers', 'GLM 5.2', 'LeRobot v0.6.0', 'Nunchaku Lite', 'qwen3-32b', 'Qwen/Qwen3-4B', 'Qwen/Qwen3.5-122B-A10B', 'Qwen/Qwen3.5-4B', 'SmolLM', 'SmolLM2-1.7B', 'SmolLM3', 'SmolLM3 3B', 'SmolLM3-3B', 'SmolVLM-256M', 'TinyLlama', 'tokenizers', 'Transformers v4', 'Transformers v5', 'TRL', 'Xenova/distilbert-base-uncased-finetuned-sst-2-english', 'Xenova/whisper-tiny.en']

Open Source 🇺🇸

Gigatoken: BPE Tokenizer in Rust Encodes Text at 24.53 GB/s, Up to 989x Faster Than HuggingFace Tokenizers

Gigatoken, a BPE tokenizer written in Rust by Stanford PhD student Marcel Rød, achieves text encoding speeds of 24.53 GB/s on a 144-core AMD EPYC system, outperforming HuggingFace tokenizers by 989x and OpenAI's tiktoken by 681x. The library supports 23 tokenizer families and attributes its speed to a hand-optimized pretokenizer using SWAR SIMD techniques and pretoken caching.

OpenAIOpenAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind MetaMeta Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Moonshot AIMoonshot AI NVIDIANVIDIA
MarkTechPost24.07 · 01:03
Fresh news