{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/quantization/papers/24","list_of":"/task/quantization","task":"Quantization","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":24,"pages_in_order":50,"rows_per_page":100,"rows":[2301,2400],"of":4925,"counts":{"archive_papers_tagged":4925,"with_a_code_link":1596,"where_syntology_ran_a_sample":515,"not_listed_spam_title":0,"listed":4925,"listed_where_code_ran":515,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":452,"every_run_a_failure_of_syntologys_instrument":63,"listed_with_a_run_with_no_instrument_failure":452,"listed_every_run_a_failure_of_syntologys_instrument":63,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/quantization","prev":"/task/quantization/papers/23","next":"/task/quantization/papers/25","papers":[{"url":null,"slug":"dynamic-error-bounded-hierarchical-matrices","title":"Adaptive Error-Bounded Hierarchical Matrices for Efficient Neural Network Compression","date":"2024-09-11","arxiv_id":"2409.07028","repositories_listed":0,"syntology":null},{"url":null,"slug":"nvrc-neural-video-representation-compression","title":"NVRC: Neural Video Representation Compression","date":"2024-09-11","arxiv_id":"2409.07414","repositories_listed":0,"syntology":null},{"url":null,"slug":"store-streamlining-semantic-tokenization-and","title":"STORE: Streamlining Semantic Tokenization and Generative Recommendation with A Single LLM","date":"2024-09-11","arxiv_id":"2409.07276","repositories_listed":0,"syntology":null},{"url":null,"slug":"agileir-memory-efficient-group-shifted","title":"AgileIR: Memory-Efficient Group Shifted Windows Attention for Agile Image Restoration","date":"2024-09-10","arxiv_id":"2409.06206","repositories_listed":0,"syntology":null},{"url":null,"slug":"rate-constrained-quantization-for","title":"Rate-Constrained Quantization for Communication-Efficient Federated Learning","date":"2024-09-10","arxiv_id":"2409.06319","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-optimization-with-finite-bit","title":"Distributed Optimization with Finite Bit Adaptive Quantization for Efficient Communication and Precision Enhancement","date":"2024-09-09","arxiv_id":"2409.05418","repositories_listed":0,"syntology":null},{"url":null,"slug":"ecg-biometric-authentication-using-self","title":"ECG Biometric Authentication Using Self-Supervised Learning for IoT Edge Sensors","date":"2024-09-09","arxiv_id":"2409.05627","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-the-completeness-of-discrete","title":"Estimating the Completeness of Discrete Speech Units","date":"2024-09-09","arxiv_id":"2409.06109","repositories_listed":0,"syntology":null},{"url":null,"slug":"sgc-vqgan-towards-complex-scene","title":"SGC-VQGAN: Towards Complex Scene Representation via Semantic Guided Clustering Codebook","date":"2024-09-09","arxiv_id":"2409.06105","repositories_listed":0,"syntology":null},{"url":null,"slug":"tripleplay-enhancing-federated-learning-with","title":"TriplePlay: Enhancing Federated Learning with CLIP for Non-IID Data and Resource Efficiency","date":"2024-09-09","arxiv_id":"2409.05347","repositories_listed":0,"syntology":null},{"url":null,"slug":"blind-adaptive-quantizers","title":"Blind-Adaptive Quantizers","date":"2024-09-06","arxiv_id":"2409.04077","repositories_listed":0,"syntology":null},{"url":null,"slug":"opal-outlier-preserved-microscaling","title":"OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models","date":"2024-09-06","arxiv_id":"2409.05902","repositories_listed":0,"syntology":null},{"url":"/paper/last-language-model-aware-speech-tokenization","slug":"last-language-model-aware-speech-tokenization","title":"LAST: Language Model Aware Speech Tokenization","date":"2024-09-05","arxiv_id":"2409.03701","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-ci-assessing-contextual-integrity-norms","title":"Investigating Privacy Bias in Training Data of Language Models","date":"2024-09-05","arxiv_id":"2409.03735","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-quantization-for-mathcal-l-2","title":"Recursive Quantization for $\\mathcal{L}_2$ Stabilization of a Finite Capacity Stochastic Control Loop with Intermittent State Observations","date":"2024-09-05","arxiv_id":"2409.03398","repositories_listed":0,"syntology":null},{"url":null,"slug":"watermas-sharpness-aware-maximization-for","title":"WaterMAS: Sharpness-Aware Maximization for Neural Network Watermarking","date":"2024-09-05","arxiv_id":"2409.03902","repositories_listed":0,"syntology":null},{"url":null,"slug":"coast-validation-free-contribution-assessment","title":"CoAst: Validation-Free Contribution Assessment for Federated Learning based on Cross-Round Valuation","date":"2024-09-04","arxiv_id":"2409.02495","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-rate-distortion-perception-coding","title":"Gaussian Rate-Distortion-Perception Coding and Entropy-Constrained Scalar Quantization","date":"2024-09-04","arxiv_id":"2409.02388","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-task-based-trainable-neuromorphic","title":"Learning Task-Based Trainable Neuromorphic ADCs via Power-Aware Distillation","date":"2024-09-04","arxiv_id":"2409.15300","repositories_listed":0,"syntology":null},{"url":"/paper/sorbet-a-neuromorphic-hardware-compatible","slug":"sorbet-a-neuromorphic-hardware-compatible","title":"Sorbet: A Neuromorphic Hardware-Compatible Transformer-Based Spiking Language Model","date":"2024-09-04","arxiv_id":"2409.15298","repositories_listed":0,"syntology":{"n":4,"n_ran":4,"n_constructed":3,"n_ran_checked":4,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":3,"n_pointer_only":4,"phrase":"4 ran (of which 3 constructed an object rather than computing a result; 4 with no instrument failure: 1 honoured, 0 violated, 3 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/sorbet-a-neuromorphic-hardware-compatible#ran","syntology_url":"https://syntology.ai/paper/2409.15298","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2409.15298"}},"official":null}},{"url":null,"slug":"task-oriented-communication-for-graph-data-a","title":"Task-Oriented Communication for Graph Data: A Graph Information Bottleneck Approach","date":"2024-09-04","arxiv_id":"2409.02728","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundations-of-large-language-model","title":"Foundations of Large Language Model Compression -- Part 1: Weight Quantization","date":"2024-09-03","arxiv_id":"2409.02026","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-and-deployment-of-deep-neural","title":"Optimization and Deployment of Deep Neural Networks for PPG-based Blood Pressure Estimation Targeting Low-power Wearables","date":"2024-09-03","arxiv_id":"2409.07485","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressing-vae-based-out-of-distribution","title":"Compressing VAE-Based Out-of-Distribution Detectors for Embedded Deployment","date":"2024-09-02","arxiv_id":"2409.00880","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-ai-evaluation-of-model-compression","title":"Edge AI: Evaluation of Model Compression Techniques for Convolutional Neural Networks","date":"2024-09-02","arxiv_id":"2409.02134","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-index-vector-quantization-based","title":"One-Index Vector Quantization Based Adversarial Attack on Image Classification","date":"2024-09-02","arxiv_id":"2409.01282","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-multi-stream-beamforming-through","title":"Enhancing Multi-Stream Beamforming Through CQIs For 5G NR FDD Massive MIMO Communications: A Tuning-Free Scheme","date":"2024-09-01","arxiv_id":"2409.00716","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-aggregation-of-mallows-rankings-a","title":"Federated Aggregation of Mallows Rankings: A Comparative Analysis of Borda and Lehmer Coding","date":"2024-09-01","arxiv_id":"2409.00848","repositories_listed":0,"syntology":null},{"url":null,"slug":"accurate-compression-of-text-to-image","title":"Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization","date":"2024-08-31","arxiv_id":"2409.00492","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximately-invertible-neural-network-for","title":"Approximately Invertible Neural Network for Learned Image Compression","date":"2024-08-30","arxiv_id":"2408.17073","repositories_listed":0,"syntology":null},{"url":null,"slug":"vq4dit-efficient-post-training-vector","title":"VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers","date":"2024-08-30","arxiv_id":"2408.17131","repositories_listed":0,"syntology":null},{"url":null,"slug":"blending-low-and-high-level-semantics-of-time","title":"Blending Low and High-Level Semantics of Time Series for Better Masked Time Series Generation","date":"2024-08-29","arxiv_id":"2408.16613","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-device-ai-quantization-aware-training-of","title":"On-device AI: Quantization-aware Training of Transformers in Time-Series","date":"2024-08-29","arxiv_id":"2408.16495","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-uniqueness-of-llama3-70b-with-per-channel","title":"The Uniqueness of LLaMA3-70B Series with Per-Channel Quantization","date":"2024-08-27","arxiv_id":"2408.15301","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-resolution-inference-ari-energy","title":"Adaptive Resolution Inference (ARI): Energy-Efficient Machine Learning for Internet of Things","date":"2024-08-26","arxiv_id":"2408.14528","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusionsam-latent-space-driven-segment","title":"FusionSAM: Latent Space driven Segment Anything Model for Multimodal Fusion and Segmentation","date":"2024-08-26","arxiv_id":"2408.13980","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multivariate-fronthaul-quantization","title":"Scalable Multivariate Fronthaul Quantization for Cell-Free Massive MIMO","date":"2024-08-26","arxiv_id":"2409.06715","repositories_listed":0,"syntology":null},{"url":null,"slug":"infrared-domain-adaptation-with-zero-shot","title":"Infrared Domain Adaptation with Zero-Shot Quantization","date":"2024-08-25","arxiv_id":"2408.13925","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantized-neural-network-for-complex-hologram","title":"Quantized neural network for complex hologram generation","date":"2024-08-25","arxiv_id":"2409.06711","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-dnn-training-for-intermittently","title":"Revisiting DNN Training for Intermittently-Powered Energy-Harvesting Micro-Computers","date":"2024-08-25","arxiv_id":"2408.13696","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-autoencoder-based-neural-network","title":"Variational autoencoder-based neural network model compression","date":"2024-08-25","arxiv_id":"2408.14513","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-safe-self-evolution-algorithm-for","title":"A Safe Self-evolution Algorithm for Autonomous Driving Based on Data-Driven Risk Quantification Model","date":"2024-08-23","arxiv_id":"2408.12805","repositories_listed":0,"syntology":null},{"url":null,"slug":"informational-embodiment-computational-role","title":"Informational Embodiment: Computational role of information structure in codes and robots","date":"2024-08-23","arxiv_id":"2408.12950","repositories_listed":0,"syntology":null},{"url":null,"slug":"deephq-learned-hierarchical-quantizer-for","title":"DeepHQ: Learned Hierarchical Quantizer for Progressive Deep Image Coding","date":"2024-08-22","arxiv_id":"2408.12150","repositories_listed":0,"syntology":null},{"url":null,"slug":"matmul-or-no-matmal-in-the-era-of-1-bit-llms","title":"Matmul or No Matmal in the Era of 1-bit LLMs","date":"2024-08-21","arxiv_id":"2408.11939","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-segmental-and-prosodic-factors","title":"Disentangling segmental and prosodic factors to non-native speech comprehensibility","date":"2024-08-20","arxiv_id":"2408.10997","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperstroke-a-novel-high-quality-stroke","title":"Hyperstroke: A Novel High-quality Stroke Representation for Assistive Artistic Drawing","date":"2024-08-18","arxiv_id":"2408.09348","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-cross-codec-quality-rate-convex-hulls","title":"Explore Cross-Codec Quality-Rate Convex Hulls Relation for Adaptive Streaming","date":"2024-08-16","arxiv_id":"2408.09044","repositories_listed":0,"syntology":null},{"url":null,"slug":"jpeg-lm-llms-as-image-generators-with","title":"JPEG-LM: LLMs as Image Generators with Canonical Codec Representations","date":"2024-08-15","arxiv_id":"2408.08459","repositories_listed":0,"syntology":null},{"url":null,"slug":"analog-spiking-neuron-in-cmos-28-nm-towards","title":"Analog Spiking Neuron in CMOS 28 nm Towards Large-Scale Neuromorphic Processors","date":"2024-08-14","arxiv_id":"2408.07734","repositories_listed":0,"syntology":null},{"url":null,"slug":"line-spectral-estimation-with-unlimited","title":"Line Spectral Estimation with Unlimited Sensing","date":"2024-08-13","arxiv_id":"2408.06597","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-bitwidth-floating-point-quantization-for","title":"Low-Bitwidth Floating Point Quantization for Efficient High-Quality Diffusion Models","date":"2024-08-13","arxiv_id":"2408.06995","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-tuning-as-user-inherent-profile","title":"Prompt Tuning as User Inherent Profile Inference Machine","date":"2024-08-13","arxiv_id":"2408.06577","repositories_listed":0,"syntology":null},{"url":null,"slug":"computability-of-classification-and-deep","title":"Computability of Classification and Deep Learning: From Theoretical Limits to Practical Feasibility through Quantization","date":"2024-08-12","arxiv_id":"2408.06212","repositories_listed":0,"syntology":null},{"url":null,"slug":"rtf-q-unsupervised-domain-adaptation-based","title":"RTF-Q: Efficient Unsupervised Domain Adaptation with Retraining-free Quantization","date":"2024-08-11","arxiv_id":"2408.05752","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-secure-multiparty-deep-learning","title":"Quantum-secure multiparty deep learning","date":"2024-08-10","arxiv_id":"2408.05629","repositories_listed":0,"syntology":null},{"url":null,"slug":"trustworthy-semantic-enabled-6g-communication","title":"Semantic-Enabled 6G Communication: A Task-oriented and Privacy-preserving Perspective","date":"2024-08-08","arxiv_id":"2408.04188","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-delay-qkv-compression-for-mitigating-kv","title":"FDC: Fast KV Dimensionality Compression for Efficient LLM Inference","date":"2024-08-07","arxiv_id":"2408.04107","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02945","title":"Self-Supervised Learning for Multi-Channel Neural Transducer","date":"2024-08-06","arxiv_id":"2408.02945","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02961","title":"Synaptic Modulation using Interspike Intervals Increases Energy Efficiency of Spiking Neural Networks","date":"2024-08-06","arxiv_id":"2408.02961","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03033","title":"L3iTC at the FinLLM Challenge Task: Quantization for Financial Text Classification & Summarization","date":"2024-08-06","arxiv_id":"2408.03033","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03130","title":"Inference Optimizations for Large Language Models: Effects, Challenges, and Practical Considerations","date":"2024-08-06","arxiv_id":"2408.03130","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03291","title":"DopQ-ViT: Towards Distribution-Friendly and Outlier-Aware Post-Training Quantization for Vision Transformers","date":"2024-08-06","arxiv_id":"2408.03291","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02341","title":"An approach to optimize inference of the DIART speaker diarization pipeline","date":"2024-08-05","arxiv_id":"2408.02341","repositories_listed":0,"syntology":null},{"url":null,"slug":"nonlinear-perturbation-based-non-convex","title":"Nonlinear Perturbation-based Non-Convex Optimization over Time-Varying Networks","date":"2024-08-05","arxiv_id":"2408.02269","repositories_listed":0,"syntology":null},{"url":null,"slug":"winning-amazon-kdd-cup-24","title":"Winning Amazon KDD Cup'24","date":"2024-08-05","arxiv_id":"2408.04658","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01803","title":"STBLLM: Breaking the 1-Bit Barrier with Structured Binary LLMs","date":"2024-08-03","arxiv_id":"2408.01803","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01332","title":"HMDN: Hierarchical Multi-Distribution Network for Click-Through Rate Prediction","date":"2024-08-02","arxiv_id":"2408.01332","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-00232","title":"CDFGNN: a Systematic Design of Cache-based Distributed Full-Batch Graph Neural Network Training with Communication Reduction","date":"2024-08-01","arxiv_id":"2408.00232","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-00863","title":"UniMoT: Unified Molecule-Text Language Model with Discrete Token Representation","date":"2024-08-01","arxiv_id":"2408.00863","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-00923","title":"Reclaiming Residual Knowledge: A Novel Paradigm to Low-Bit Quantization","date":"2024-08-01","arxiv_id":"2408.00923","repositories_listed":0,"syntology":null},{"url":null,"slug":"2407-21488","title":"Breaking the Hourglass Phenomenon of Residual Quantization: Enhancing the Upper Bound of Generative Retrieval","date":"2024-07-31","arxiv_id":"2407.21488","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-change-blindness-for-video-coding","title":"Exploiting Change Blindness for Video Coding: Perspectives from a Less Promising User Study","date":"2024-07-31","arxiv_id":"2408.00052","repositories_listed":0,"syntology":null},{"url":null,"slug":"abstractive-summarization-from-audio","title":"Abstractive summarization from Audio Transcription","date":"2024-07-30","arxiv_id":"2408.04639","repositories_listed":0,"syntology":null},{"url":"/paper/think-thinner-key-cache-by-query-driven","slug":"think-thinner-key-cache-by-query-driven","title":"ThinK: Thinner Key Cache by Query-Driven Pruning","date":"2024-07-30","arxiv_id":"2407.21018","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/think-thinner-key-cache-by-query-driven#ran","syntology_url":"https://syntology.ai/paper/2407.21018","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2407.21018"}},"official":null}},{"url":null,"slug":"mimiq-low-bit-data-free-quantization-of","title":"MimiQ: Low-Bit Data-Free Quantization of Vision Transformers with Encouraging Inter-Head Attention Similarity","date":"2024-07-29","arxiv_id":"2407.20021","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-agnostic-hybrid-sharding-for","title":"Model Agnostic Hybrid Sharding For Heterogeneous Distributed Inference","date":"2024-07-29","arxiv_id":"2407.19775","repositories_listed":0,"syntology":null},{"url":null,"slug":"reputation-driven-asynchronous-federated","title":"Reputation-Driven Asynchronous Federated Learning for Enhanced Trajectory Prediction with Blockchain","date":"2024-07-28","arxiv_id":"2407.19428","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-interpretability-of-codebooks-in-model","title":"The Interpretability of Codebooks in Model-Based Reinforcement Learning is Limited","date":"2024-07-28","arxiv_id":"2407.19532","repositories_listed":0,"syntology":null},{"url":null,"slug":"quasar-vit-hardware-oriented-quantization","title":"Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers","date":"2024-07-25","arxiv_id":"2407.18175","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-tokens-as-data-points-for","title":"Unlocking Tokens as Data Points for Generalization Bounds on Larger Language Models","date":"2024-07-25","arxiv_id":"2407.18158","repositories_listed":0,"syntology":null},{"url":null,"slug":"pixel-embedding-fully-quantized-convolutional","title":"Pixel Embedding: Fully Quantized Convolutional Neural Network with Differentiable Lookup Table","date":"2024-07-23","arxiv_id":"2407.16174","repositories_listed":0,"syntology":null},{"url":null,"slug":"compensate-quantization-errors-quantized","title":"Compensate Quantization Errors+: Quantized Models Are Inquisitive Learners","date":"2024-07-22","arxiv_id":"2407.15508","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-study-on-performance-evaluation","title":"Comprehensive Study on Performance Evaluation and Optimization of Model Compression: Bridging Traditional Deep Learning and Large Language Models","date":"2024-07-22","arxiv_id":"2407.15904","repositories_listed":0,"syntology":null},{"url":null,"slug":"uplink-transmit-power-optimization-for","title":"Uplink Transmit Power Optimization for Distributed Massive MIMO Systems with 1-Bit ADCs","date":"2024-07-22","arxiv_id":"2407.15416","repositories_listed":0,"syntology":null},{"url":null,"slug":"feddm-enhancing-communication-efficiency-and","title":"FedDM: Enhancing Communication Efficiency and Handling Data Heterogeneity in Federated Diffusion Models","date":"2024-07-20","arxiv_id":"2407.14730","repositories_listed":0,"syntology":null},{"url":null,"slug":"power-measurement-enabled-channel","title":"Power Measurement Enabled Channel Autocorrelation Matrix Estimation for IRS-Assisted Wireless Communication","date":"2024-07-20","arxiv_id":"2407.20252","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-of-experts-with-mixture-of-precisions","title":"Mixture of Experts with Mixture of Precisions for Tuning Quality of Service","date":"2024-07-19","arxiv_id":"2407.14417","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-optimal-closed-form-phase","title":"Asymptotically Optimal Closed-Form Phase Configuration of $1$-bit RISs via Sign Alignment","date":"2024-07-18","arxiv_id":"2407.13510","repositories_listed":0,"syntology":null},{"url":null,"slug":"linr-model-based-neural-retrieval-on-gpus-at","title":"LiNR: Model Based Neural Retrieval on GPUs at LinkedIn","date":"2024-07-18","arxiv_id":"2407.13218","repositories_listed":0,"syntology":null},{"url":null,"slug":"fetch-a-memory-efficient-replay-approach-for","title":"FETCH: A Memory-Efficient Replay Approach for Continual Learning in Image Classification","date":"2024-07-17","arxiv_id":"2407.12375","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamba-ptq-outlier-channels-in-recurrent-large","title":"Mamba-PTQ: Outlier Channels in Recurrent Large Language Models","date":"2024-07-17","arxiv_id":"2407.12397","repositories_listed":0,"syntology":null},{"url":null,"slug":"mcu-mixq-a-hw-sw-co-optimized-mixed-precision","title":"MCU-MixQ: A HW/SW Co-optimized Mixed-precision Neural Network Design Framework for MCUs","date":"2024-07-17","arxiv_id":"2407.18267","repositories_listed":0,"syntology":null},{"url":null,"slug":"smartquant-cxl-based-ai-model-store-in","title":"SmartQuant: CXL-based AI Model Store in Support of Runtime Configurable Weight Quantization","date":"2024-07-17","arxiv_id":"2407.15866","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-int4-fixed-point-training-via","title":"Toward INT4 Fixed-Point Training via Exploring Quantization Error for Gradients","date":"2024-07-17","arxiv_id":"2407.12637","repositories_listed":0,"syntology":null},{"url":null,"slug":"co-designing-binarized-transformer-and","title":"Co-Designing Binarized Transformer and Hardware Accelerator for Efficient End-to-End Edge Deployment","date":"2024-07-16","arxiv_id":"2407.12070","repositories_listed":0,"syntology":null},{"url":null,"slug":"lrq-optimizing-post-training-quantization-for","title":"LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling Matrices","date":"2024-07-16","arxiv_id":"2407.11534","repositories_listed":0,"syntology":null},{"url":null,"slug":"qvd-post-training-quantization-for-video","title":"QVD: Post-training Quantization for Video Diffusion Models","date":"2024-07-16","arxiv_id":"2407.11585","repositories_listed":0,"syntology":null},{"url":null,"slug":"rate-distortion-cognition-controllable","title":"Rate-Distortion-Cognition Controllable Versatile Neural Image Compression","date":"2024-07-16","arxiv_id":"2407.11700","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiled-bit-networks-sub-bit-neural-network","title":"Tiled Bit Networks: Sub-Bit Neural Network Compression Through Reuse of Learnable Binary Vectors","date":"2024-07-16","arxiv_id":"2407.12075","repositories_listed":0,"syntology":null}],"record_sha256":"f97c584a3b73911f519c2a32c8ce1809ff0a47daf9f9de897e9f7c1be4c50f54","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}