{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/quantization/papers/27","list_of":"/task/quantization","task":"Quantization","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":27,"pages_in_order":50,"rows_per_page":100,"rows":[2601,2700],"of":4925,"counts":{"archive_papers_tagged":4925,"with_a_code_link":1596,"where_syntology_ran_a_sample":515,"not_listed_spam_title":0,"listed":4925,"listed_where_code_ran":515,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":452,"every_run_a_failure_of_syntologys_instrument":63,"listed_with_a_run_with_no_instrument_failure":452,"listed_every_run_a_failure_of_syntologys_instrument":63,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/quantization","prev":"/task/quantization/papers/26","next":"/task/quantization/papers/28","papers":[{"url":null,"slug":"investigating-the-impact-of-quantization-on","title":"Investigating the Impact of Quantization on Adversarial Robustness","date":"2024-04-08","arxiv_id":"2404.05639","repositories_listed":0,"syntology":null},{"url":null,"slug":"physics-of-language-models-part-3-3-knowledge","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","date":"2024-04-08","arxiv_id":"2404.05405","repositories_listed":0,"syntology":null},{"url":null,"slug":"gull-a-generative-multifunctional-audio-codec","title":"Gull: A Generative Multifunctional Audio Codec","date":"2024-04-07","arxiv_id":"2404.04947","repositories_listed":0,"syntology":null},{"url":null,"slug":"nanometer-scanning-with-micrometer-sensing","title":"Nanometer Scanning with Micrometer Sensing: Beating Quantization Constraints in Lissajous Trajectory Tracking","date":"2024-04-07","arxiv_id":"2404.04973","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-happens-when-small-is-made-smaller","title":"What Happens When Small Is Made Smaller? Exploring the Impact of Compression on Small Data Pretrained Language Models","date":"2024-04-06","arxiv_id":"2404.04759","repositories_listed":0,"syntology":null},{"url":null,"slug":"increased-llm-vulnerabilities-from-fine","title":"Fine-Tuning, Quantization, and LLMs: Navigating Unintended Outcomes","date":"2024-04-05","arxiv_id":"2404.04392","repositories_listed":0,"syntology":null},{"url":null,"slug":"di-retinex-digital-imaging-retinex-theory-for","title":"DI-Retinex: Digital-Imaging Retinex Theory for Low-Light Image Enhancement","date":"2024-04-04","arxiv_id":"2404.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"tinyvqa-compact-multimodal-deep-neural","title":"TinyVQA: Compact Multimodal Deep Neural Network for Visual Question Answering on Resource-Constrained Devices","date":"2024-04-04","arxiv_id":"2404.03574","repositories_listed":0,"syntology":null},{"url":null,"slug":"cherry-on-top-parameter-heterogeneity-and","title":"Cherry on Top: Parameter Heterogeneity and Quantization in Large Language Models","date":"2024-04-03","arxiv_id":"2404.02837","repositories_listed":0,"syntology":null},{"url":null,"slug":"clam-tts-improving-neural-codec-language","title":"CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech","date":"2024-04-03","arxiv_id":"2404.02781","repositories_listed":0,"syntology":null},{"url":null,"slug":"dnn-memory-footprint-reduction-via-post","title":"DNN Memory Footprint Reduction via Post-Training Intra-Layer Multi-Precision Quantization","date":"2024-04-03","arxiv_id":"2404.02947","repositories_listed":0,"syntology":null},{"url":null,"slug":"nerfcodec-neural-feature-compression-meets","title":"NeRFCodec: Neural Feature Compression Meets Neural Radiance Fields for Memory-Efficient Scene Representation","date":"2024-04-02","arxiv_id":"2404.02185","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-effect-of-quantization-on-dynamic-mode","title":"On the Effect of Quantization on Dynamic Mode Decomposition","date":"2024-04-02","arxiv_id":"2404.02014","repositories_listed":0,"syntology":null},{"url":null,"slug":"refqsr-reference-based-quantization-for-image","title":"RefQSR: Reference-based Quantization for Image Super-Resolution Networks","date":"2024-04-02","arxiv_id":"2404.01690","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-audio-representation-for-music-genre","title":"A Novel Audio Representation for Music Genre Identification in MIR","date":"2024-04-01","arxiv_id":"2404.01058","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-aware-group-quantization-for-vision","title":"Instance-Aware Group Quantization for Vision Transformers","date":"2024-04-01","arxiv_id":"2404.00928","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-variable-and-coordinated-holistic-co","title":"Towards Variable and Coordinated Holistic Co-Speech Motion Generation","date":"2024-03-30","arxiv_id":"2404.00368","repositories_listed":0,"syntology":null},{"url":null,"slug":"accurate-block-quantization-in-llms-with","title":"Accurate Block Quantization in LLMs with Outliers","date":"2024-03-29","arxiv_id":"2403.20137","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-lite-high-efficiency-deployment","title":"Transformer-Lite: High-efficiency Deployment of Large Language Models on Mobile Phone GPUs","date":"2024-03-29","arxiv_id":"2403.20041","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-heuristic-fronthaul-bit-allocation-for","title":"Meta-Heuristic Fronthaul Bit Allocation for Cell-free Massive MIMO Systems","date":"2024-03-28","arxiv_id":"2403.19132","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-deep-video-compression-with-1","title":"Uncertainty-Aware Deep Video Compression with Ensembles","date":"2024-03-28","arxiv_id":"2403.19158","repositories_listed":0,"syntology":null},{"url":null,"slug":"within-the-dynamic-context-inertia-aware-3d","title":"Within the Dynamic Context: Inertia-aware 3D Human Modeling with Pose Sequence","date":"2024-03-28","arxiv_id":"2403.19160","repositories_listed":0,"syntology":null},{"url":null,"slug":"chain-of-compression-a-systematic-approach-to","title":"Order of Compression: A Systematic and Optimal Sequence to Combinationally Compress CNN","date":"2024-03-26","arxiv_id":"2403.17447","repositories_listed":0,"syntology":null},{"url":null,"slug":"oh-we-freeze-improving-quantized-knowledge","title":"Oh! We Freeze: Improving Quantized Knowledge Distillation via Signal Propagation Analysis for Large Language Models","date":"2024-03-26","arxiv_id":"2403.18159","repositories_listed":0,"syntology":null},{"url":"/paper/flasheval-towards-fast-and-accurate","slug":"flasheval-towards-fast-and-accurate","title":"FlashEval: Towards Fast and Accurate Evaluation of Text-to-image Diffusion Generative Models","date":"2024-03-25","arxiv_id":"2403.16379","repositories_listed":0,"syntology":{"n":5,"n_ran":4,"n_constructed":0,"n_ran_checked":0,"n_instrument":4,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":5,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 4 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/flasheval-towards-fast-and-accurate#ran","syntology_url":"https://syntology.ai/paper/2403.16379","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2403.16379"}},"official":null}},{"url":null,"slug":"neural-image-compression-with-quantization","title":"Neural Image Compression with Quantization Rectifier","date":"2024-03-25","arxiv_id":"2403.17236","repositories_listed":0,"syntology":null},{"url":"/paper/work-in-progress-linear-transformers-for","slug":"work-in-progress-linear-transformers-for","title":"Work in Progress: Linear Transformers for TinyML","date":"2024-03-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"infrastructure-assisted-collaborative","title":"Infrastructure-Assisted Collaborative Perception in Automated Valet Parking: A Safety Perspective","date":"2024-03-22","arxiv_id":"2403.15156","repositories_listed":0,"syntology":null},{"url":null,"slug":"magic-for-the-age-of-quantized-dnns","title":"Magic for the Age of Quantized DNNs","date":"2024-03-22","arxiv_id":"2403.14999","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-privacy-with-non-private-pre","title":"Provable Privacy with Non-Private Pre-Processing","date":"2024-03-19","arxiv_id":"2403.13041","repositories_listed":0,"syntology":null},{"url":null,"slug":"super-high-fidelity-image-compression-via","title":"Super-High-Fidelity Image Compression via Hierarchical-ROI and Adaptive Quantization","date":"2024-03-19","arxiv_id":"2403.13030","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-compressed-trust-scrutinizing-the","title":"Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression","date":"2024-03-18","arxiv_id":"2403.15447","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-frequency-based-upsampling-and","title":"Hierarchical Frequency-based Upsampling and Refining for Compressed Video Quality Enhancement","date":"2024-03-18","arxiv_id":"2403.11556","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypervq-mlr-based-vector-quantization-in","title":"HyperVQ: MLR-based Vector Quantization in Hyperbolic Space","date":"2024-03-18","arxiv_id":"2403.13015","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatio-temporal-fluid-dynamics-modeling-via","title":"Spatio-Temporal Fluid Dynamics Modeling via Physical-Awareness and Parameter Diffusion Guidance","date":"2024-03-18","arxiv_id":"2403.13850","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantization-avoids-saddle-points-in","title":"Quantization Avoids Saddle Points in Distributed Optimization","date":"2024-03-15","arxiv_id":"2403.10423","repositories_listed":0,"syntology":null},{"url":null,"slug":"briedge-eeg-adaptive-edge-ai-for-multi-brain","title":"BRIEDGE: EEG-Adaptive Edge AI for Multi-Brain to Multi-Robot Interaction","date":"2024-03-14","arxiv_id":"2403.15432","repositories_listed":0,"syntology":null},{"url":null,"slug":"crb-analysis-for-mixed-adc-based-doa","title":"CRB Analysis for Mixed-ADC Based DOA Estimation","date":"2024-03-14","arxiv_id":"2403.09301","repositories_listed":0,"syntology":null},{"url":null,"slug":"fedcomloc-communication-efficient-distributed","title":"FedComLoc: Communication-Efficient Distributed Training of Sparse and Quantized Models","date":"2024-03-14","arxiv_id":"2403.09904","repositories_listed":0,"syntology":null},{"url":null,"slug":"unicode-learning-a-unified-codebook-for","title":"UniCode: Learning a Unified Codebook for Multimodal Large Language Models","date":"2024-03-14","arxiv_id":"2403.09072","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-automotive-radar-sensing-via","title":"Collaborative Automotive Radar Sensing via Mixed-Precision Distributed Array Completion","date":"2024-03-13","arxiv_id":"2403.08168","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategizing-against-q-learners-a-control","title":"Strategizing against Q-learners: A Control-theoretical Approach","date":"2024-03-13","arxiv_id":"2403.08906","repositories_listed":0,"syntology":null},{"url":null,"slug":"approaching-rate-distortion-limits-in-neural","title":"Approaching Rate-Distortion Limits in Neural Compression with Lattice Transform Coding","date":"2024-03-12","arxiv_id":"2403.07320","repositories_listed":0,"syntology":null},{"url":null,"slug":"vector-quantization-for-deep-learning-based","title":"Vector Quantization for Deep-Learning-Based CSI Feedback in Massive MIMO Systems","date":"2024-03-12","arxiv_id":"2403.07355","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowvqtalker-high-quality-emotional-talking","title":"FlowVQTalker: High-Quality Emotional Talking Face Generation through Normalizing Flow and Quantization","date":"2024-03-11","arxiv_id":"2403.06375","repositories_listed":0,"syntology":null},{"url":null,"slug":"quanttune-optimizing-model-quantization-with","title":"QuantTune: Optimizing Model Quantization with Adaptive Outlier-Driven Fine Tuning","date":"2024-03-11","arxiv_id":"2403.06497","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-makes-quantization-for-large-language","title":"What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation","date":"2024-03-11","arxiv_id":"2403.06408","repositories_listed":0,"syntology":null},{"url":null,"slug":"micro-fracture-detection-in-photovoltaic","title":"Micro-Fracture Detection in Photovoltaic Cells with Hardware-Constrained Devices and Computer Vision","date":"2024-03-08","arxiv_id":"2403.05694","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-quantization-on-the-robustness","title":"The Impact of Quantization on the Robustness of Transformer-based Text Classifiers","date":"2024-03-08","arxiv_id":"2403.05365","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-the-potential-of-multimodal-unified","title":"Enhancing Multimodal Unified Representations for Cross Modal Generalization","date":"2024-03-08","arxiv_id":"2403.05168","repositories_listed":0,"syntology":null},{"url":null,"slug":"locodl-communication-efficient-distributed","title":"LoCoDL: Communication-Efficient Distributed Learning with Local Training and Compression","date":"2024-03-07","arxiv_id":"2403.04348","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-demand-quantization-for-green-federated","title":"On-demand Quantization for Green Federated Generative Diffusion in Mobile Edge Networks","date":"2024-03-07","arxiv_id":"2403.04430","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-integrate-and-fire-time-encoding","title":"Adaptive Integrate-and-Fire Time Encoding Machine with Quantization","date":"2024-03-05","arxiv_id":"2403.02992","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learned-compression-for-radio-frequency","title":"Deep-Learned Compression for Radio-Frequency Signal Classification","date":"2024-03-05","arxiv_id":"2403.03150","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-of-stochastic-quantizers-for-privacy","title":"Design of Stochastic Quantizers for Privacy Preservation","date":"2024-03-05","arxiv_id":"2403.03048","repositories_listed":0,"syntology":null},{"url":null,"slug":"easyquant-an-efficient-data-free-quantization","title":"EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs","date":"2024-03-05","arxiv_id":"2403.02775","repositories_listed":0,"syntology":null},{"url":null,"slug":"vqsynery-robust-drug-synergy-prediction-with","title":"VQSynery: Robust Drug Synergy Prediction With Vector Quantization Mechanism","date":"2024-03-05","arxiv_id":"2403.03089","repositories_listed":0,"syntology":null},{"url":null,"slug":"better-schedules-for-low-precision-training","title":"Better Schedules for Low Precision Training of Deep Neural Networks","date":"2024-03-04","arxiv_id":"2403.02243","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowprecision-advancing-fpga-based-real-time","title":"FlowPrecision: Advancing FPGA-Based Real-Time Fluid Flow Estimation with Linear Quantization","date":"2024-03-04","arxiv_id":"2403.01922","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-deep-autoencoders-for","title":"Towards efficient deep autoencoders for multivariate time series anomaly detection","date":"2024-03-04","arxiv_id":"2403.02429","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-compressibility-of-quantized-large","title":"On the Compressibility of Quantized Large Language Models","date":"2024-03-03","arxiv_id":"2403.01384","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantized-hierarchical-federated-learning-a","title":"A Hierarchical Federated Learning Approach for the Internet of Things","date":"2024-03-03","arxiv_id":"2403.01540","repositories_listed":0,"syntology":null},{"url":null,"slug":"basedai-a-decentralized-p2p-network-for-zero","title":"BasedAI: A decentralized P2P network for Zero Knowledge Large Language Models (ZK-LLMs)","date":"2024-03-01","arxiv_id":"2403.01008","repositories_listed":0,"syntology":null},{"url":null,"slug":"t3dnet-compressing-point-cloud-models-for","title":"T3DNet: Compressing Point Cloud Models for Lightweight 3D Recognition","date":"2024-02-29","arxiv_id":"2402.19264","repositories_listed":0,"syntology":null},{"url":null,"slug":"ef-quantface-streamlined-face-recognition","title":"Ef-QuantFace: Streamlined Face Recognition with Small Data and Low-Bit Precision","date":"2024-02-28","arxiv_id":"2402.18163","repositories_listed":0,"syntology":null},{"url":null,"slug":"flattenquant-breaking-through-the-inference","title":"FlattenQuant: Breaking Through the Inference Compute-bound for Large Language Models with Per-tensor Quantization","date":"2024-02-28","arxiv_id":"2402.17985","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-token-left-behind-reliable-kv-cache","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","date":"2024-02-28","arxiv_id":"2402.18096","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-quantization-with-mixed-precision","title":"Adaptive quantization with mixed-precision based on low-cost proxy","date":"2024-02-27","arxiv_id":"2402.17706","repositories_listed":0,"syntology":null},{"url":null,"slug":"inpainting-computational-fluid-dynamics-with","title":"Inpainting Computational Fluid Dynamics with Deep Learning","date":"2024-02-27","arxiv_id":"2402.17185","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-mutual-information-for-language","title":"Rethinking Mutual Information for Language Conditioned Skill Discovery on Imitation Learning","date":"2024-02-27","arxiv_id":"2402.17511","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-freeweight-compress-and-denoise-for","title":"Data-freeWeight Compress and Denoise for Large Language Models","date":"2024-02-26","arxiv_id":"2402.16319","repositories_listed":0,"syntology":null},{"url":null,"slug":"distortion-controlled-dithering-with-reduced","title":"Distortion-Controlled Dithering with Reduced Recompression Rate","date":"2024-02-26","arxiv_id":"2402.16447","repositories_listed":0,"syntology":null},{"url":null,"slug":"spc-nerf-spatial-predictive-compression-for","title":"SPC-NeRF: Spatial Predictive Compression for Voxel Based Radiance Field","date":"2024-02-26","arxiv_id":"2402.16366","repositories_listed":0,"syntology":null},{"url":null,"slug":"gptvq-the-blessing-of-dimensionality-for-llm","title":"GPTVQ: The Blessing of Dimensionality for LLM Quantization","date":"2024-02-23","arxiv_id":"2402.15319","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-organizational-principles-of-neural","title":"On the Arrow of Inference","date":"2024-02-22","arxiv_id":"2402.14186","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-me-the-data-generating-ground-pressure","title":"Text me the data: Generating Ground Pressure Sequence from Textual Descriptions for HAR","date":"2024-02-22","arxiv_id":"2402.14427","repositories_listed":0,"syntology":null},{"url":null,"slug":"aptq-attention-aware-post-training-mixed","title":"APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models","date":"2024-02-21","arxiv_id":"2402.14866","repositories_listed":0,"syntology":null},{"url":null,"slug":"fingpt-hpc-efficient-pretraining-and","title":"FinGPT-HPC: Efficient Pretraining and Finetuning Large Language Models for Financial Applications with High-Performance Computing","date":"2024-02-21","arxiv_id":"2402.13533","repositories_listed":0,"syntology":null},{"url":null,"slug":"push-quantization-aware-training-toward-full","title":"In-Distribution Consistency Regularization Improves the Generalization of Quantization-Aware Training","date":"2024-02-21","arxiv_id":"2402.13497","repositories_listed":0,"syntology":null},{"url":null,"slug":"db-llm-accurate-dual-binarization-for","title":"DB-LLM: Accurate Dual-Binarization for Efficient LLMs","date":"2024-02-19","arxiv_id":"2402.11960","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-it-a-free-lunch-for-removing-outliers","title":"Is It a Free Lunch for Removing Outliers during Pretraining?","date":"2024-02-19","arxiv_id":"2402.12102","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-tailored-mixed-precision-sub-8bit","title":"Towards a tailored mixed-precision sub-8-bit quantization scheme for Gated Recurrent Units using Genetic Algorithms","date":"2024-02-19","arxiv_id":"2402.12263","repositories_listed":0,"syntology":null},{"url":null,"slug":"wkvquant-quantizing-weight-and-key-value","title":"WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More","date":"2024-02-19","arxiv_id":"2402.12065","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-bit-quantization-and-sparsification-for","title":"One-Bit Quantization and Sparsification for Multiclass Linear Classification with Strong Regularization","date":"2024-02-16","arxiv_id":"2402.10474","repositories_listed":0,"syntology":null},{"url":null,"slug":"qdylora-quantized-dynamic-low-rank-adaptation","title":"QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model Tuning","date":"2024-02-16","arxiv_id":"2402.10462","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-compression-and-efficient-inference-for","title":"Model Compression and Efficient Inference for Large Language Models: A Survey","date":"2024-02-15","arxiv_id":"2402.09748","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantized-embedding-vectors-for-controllable","title":"Quantized Embedding Vectors for Controllable Diffusion Language Models","date":"2024-02-15","arxiv_id":"2402.10107","repositories_listed":0,"syntology":null},{"url":null,"slug":"max-min-fair-energy-efficient-beam-design-for","title":"Rate-Splitting Multiple Access for Quantized ISAC LEO Satellite Systems: A Max-Min Fair Energy-Efficient Beam Design","date":"2024-02-14","arxiv_id":"2402.09253","repositories_listed":0,"syntology":null},{"url":"/paper/towards-next-level-post-training-quantization","slug":"towards-next-level-post-training-quantization","title":"Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers","date":"2024-02-14","arxiv_id":"2402.08958","repositories_listed":0,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":0,"n_instrument":3,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/towards-next-level-post-training-quantization#ran","syntology_url":"https://syntology.ai/paper/2402.08958","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2402.08958"}},"official":null}},{"url":null,"slug":"tempo-efficient-time-multiplexed-dynamic","title":"TeMPO: Efficient Time-Multiplexed Dynamic Photonic Tensor Core for Edge AI with Compact Slow-Light Electro-Optic Modulator","date":"2024-02-12","arxiv_id":"2402.07393","repositories_listed":0,"syntology":null},{"url":null,"slug":"outlier-aware-training-for-low-bit","title":"Outlier-Aware Training for Low-Bit Quantization of Structural Re-Parameterized Networks","date":"2024-02-11","arxiv_id":"2402.07200","repositories_listed":0,"syntology":null},{"url":null,"slug":"lirank-industrial-large-scale-ranking-models","title":"LiRank: Industrial Large Scale Ranking Models at LinkedIn","date":"2024-02-10","arxiv_id":"2402.06859","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-leaky-integrate-and-fire-as-spike-train","title":"On Leaky-Integrate-and Fire as Spike-Train-Quantization Operator on Dirac-Superimposed Continuous-Time Signals","date":"2024-02-10","arxiv_id":"2402.07954","repositories_listed":0,"syntology":null},{"url":null,"slug":"rqp-sgd-differential-private-machine-learning","title":"RQP-SGD: Differential Private Machine Learning through Noisy SGD and Randomized Quantization","date":"2024-02-09","arxiv_id":"2402.06606","repositories_listed":0,"syntology":null},{"url":null,"slug":"repquant-towards-accurate-post-training","title":"RepQuant: Towards Accurate Post-Training Quantization of Large Transformer Models via Scale Reparameterization","date":"2024-02-08","arxiv_id":"2402.05628","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-vq-transformer-an-ffn-free-framework","title":"Sparse-VQ Transformer: An FFN-Free Framework with Vector Quantization for Enhanced Time Series Forecasting","date":"2024-02-08","arxiv_id":"2402.05830","repositories_listed":0,"syntology":null},{"url":null,"slug":"l4q-parameter-efficient-quantization-aware","title":"L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models","date":"2024-02-07","arxiv_id":"2402.04902","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulated-overparameterization","title":"Majority Kernels: An Approach to Leverage Big Model Dynamics for Efficient Small Model Training","date":"2024-02-07","arxiv_id":"2402.05033","repositories_listed":0,"syntology":null},{"url":null,"slug":"fed-cvlc-compressing-federated-learning","title":"Fed-CVLC: Compressing Federated Learning Communications with Variable-Length Codes","date":"2024-02-06","arxiv_id":"2402.03770","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-transformer-compression","title":"A Survey on Transformer Compression","date":"2024-02-05","arxiv_id":"2402.05964","repositories_listed":0,"syntology":null}],"record_sha256":"28f26366c5ae049c65bf89fbacf662047c4166cfd6fe3fa1e5ef240fa4bb8cec","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}