{"url":"/method/hierarchical-feature-fusion","slug":"hierarchical-feature-fusion","name":"Hierarchical Feature Fusion","full_name":"Hierarchical Feature Fusion","full_name_withheld":false,"description_markdown":"**Hierarchical Feature Fusion (HFF)** is a feature fusion method employed in [ESP](https://paperswithcode.com/method/esp) and [EESP](https://paperswithcode.com/method/eesp) image model blocks for degridding. In the ESP module, concatenating the outputs of dilated convolutions gives the ESP module a large effective receptive field, but it introduces unwanted checkerboard or gridding artifacts. To address the gridding artifact in ESP, the feature maps obtained using kernels of different dilation rates are hierarchically added before concatenating them (HFF). This solution is simple and effective and does not increase the complexity of the ESP module.","description_state":"present","introduced_year":null,"introduced_by":{"title":"ESPNet: Efficient Spatial Pyramid of Dilated Convolutions for Semantic Segmentation","paper":"/paper/espnet-efficient-spatial-pyramid-of-dilated","first_author":"Sachin Mehta","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/espnet-efficient-spatial-pyramid-of-dilated"},"source":{"url":"http://arxiv.org/abs/1803.06815v3","title":"ESPNet: Efficient Spatial Pyramid of Dilated Convolutions for Semantic Segmentation","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Degridding","url":"/methods/category/degridding","pwc_aliases":[]}],"n_papers_tagged":64,"archive_num_papers":64,"papers_newest_first":[{"paper":null,"title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","date":"2025-05-31","arxiv_id":"2506.00338","n_code_links":0,"syntology":null},{"paper":null,"title":"BlobCtrl: A Unified and Flexible Framework for Element-level Image Generation and Editing","date":"2025-03-17","arxiv_id":"2503.13434","n_code_links":0,"syntology":null},{"paper":null,"title":"MSV-Mamba: A Multiscale Vision Mamba Network for Echocardiography Segmentation","date":"2025-01-13","arxiv_id":"2501.07120","n_code_links":0,"syntology":null},{"paper":"/paper/hfmf-hierarchical-fusion-meets-multi-stream","title":"HFMF: Hierarchical Fusion Meets Multi-Stream Models for Deepfake Detection","date":"2025-01-10","arxiv_id":"2501.05631","n_code_links":1,"syntology":null},{"paper":"/paper/self-paced-learning-strategy-with-easy-sample","title":"Self-Paced Learning Strategy with Easy Sample Prior Based on Confidence for the Flying Bird Object Detection Model Training","date":"2024-12-09","arxiv_id":"2412.06306","n_code_links":1,"syntology":null},{"paper":null,"title":"HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction","date":"2024-11-02","arxiv_id":"2411.01139","n_code_links":0,"syntology":null},{"paper":null,"title":"InstructBioMol: Advancing Biomolecule Understanding and Design Following Human Instructions","date":"2024-10-10","arxiv_id":"2410.07919","n_code_links":0,"syntology":null},{"paper":"/paper/espnet-codec-comprehensive-training-and","title":"ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech","date":"2024-09-24","arxiv_id":"2409.15897","n_code_links":2,"syntology":null},{"paper":null,"title":"GraspMamba: A Mamba-based Language-driven Grasp Detection Framework with Hierarchical Feature Learning","date":"2024-09-22","arxiv_id":"2409.14403","n_code_links":0,"syntology":null},{"paper":null,"title":"Coherence influx is indispensable for quantum reservoir computing","date":"2024-09-19","arxiv_id":"2409.12693","n_code_links":0,"syntology":null},{"paper":null,"title":"ESPnet-EZ: Python-only ESPnet for Easy Fine-tuning and Integration","date":"2024-09-14","arxiv_id":"2409.09506","n_code_links":0,"syntology":null},{"paper":null,"title":"The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization","date":"2024-07-23","arxiv_id":"2407.16447","n_code_links":0,"syntology":null},{"paper":null,"title":"Modality-Order Matters! A Novel Hierarchical Feature Fusion Method for CoSAm: A Code-Switched Autism Corpus","date":"2024-07-19","arxiv_id":"2407.14328","n_code_links":0,"syntology":null},{"paper":null,"title":"Advanced Multimodal Deep Learning Architecture for Image-Text Matching","date":"2024-06-13","arxiv_id":"2406.15306","n_code_links":0,"syntology":null},{"paper":null,"title":"ESP: Extro-Spective Prediction for Long-term Behavior Reasoning in Emergency Scenarios","date":"2024-05-07","arxiv_id":"2405.04100","n_code_links":0,"syntology":null},{"paper":null,"title":"A cost minimization approach to fix the vocabulary size in a tokenizer for an End-to-End ASR system","date":"2024-04-29","arxiv_id":"2406.02563","n_code_links":0,"syntology":null},{"paper":"/paper/loongserve-efficiently-serving-long-context","title":"LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism","date":"2024-04-15","arxiv_id":"2404.09526","n_code_links":1,"syntology":{"ran":2,"of":2,"unverified":0,"pointer_only":0}},{"paper":null,"title":"Towards Efficient Resume Understanding: A Multi-Granularity Multi-Modal Pre-Training Approach","date":"2024-04-13","arxiv_id":"2404.13067","n_code_links":0,"syntology":null},{"paper":null,"title":"Extending echo state property for quantum reservoir computing","date":"2024-03-05","arxiv_id":"2403.02686","n_code_links":0,"syntology":null},{"paper":null,"title":"Synthesizing Environment-Specific People in Photographs","date":"2023-12-22","arxiv_id":"2312.14579","n_code_links":0,"syntology":null},{"paper":null,"title":"Learning characteristic parameters and dynamics of centrifugal pumps under multiphase flow using physics-informed neural networks","date":"2023-10-04","arxiv_id":"2310.03001","n_code_links":0,"syntology":null},{"paper":null,"title":"Edge of stability echo state networks","date":"2023-08-05","arxiv_id":"2308.02902","n_code_links":0,"syntology":null},{"paper":null,"title":"Dynamic PlenOctree for Adaptive Sampling Refinement in Explicit NeRF","date":"2023-07-28","arxiv_id":"2307.15333","n_code_links":0,"syntology":null},{"paper":null,"title":"MaxSR: Image Super-Resolution Using Improved MaxViT","date":"2023-07-14","arxiv_id":"2307.07240","n_code_links":0,"syntology":null},{"paper":"/paper/residual-spatial-fusion-network-for-rgb","title":"Residual Spatial Fusion Network for RGB-Thermal Semantic Segmentation","date":"2023-06-17","arxiv_id":"2306.10364","n_code_links":0,"syntology":null},{"paper":"/paper/scaneru-interactive-3d-visual-grounding-based","title":"ScanERU: Interactive 3D Visual Grounding based on Embodied Reference Understanding","date":"2023-03-23","arxiv_id":"2303.13186","n_code_links":1,"syntology":null},{"paper":"/paper/fusing-pre-trained-language-models-with","title":"Fusing Pre-Trained Language Models With Multimodal Prompts Through Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/euro-espnet-unsupervised-asr-open-source","title":"EURO: ESPnet Unsupervised ASR Open-source Toolkit","date":"2022-11-30","arxiv_id":"2211.17196","n_code_links":1,"syntology":{"ran":2,"of":2,"unverified":0,"pointer_only":2}},{"paper":null,"title":"Resource-Efficient Transfer Learning From Speech Foundation Model Using Hierarchical Feature Fusion","date":"2022-11-04","arxiv_id":"2211.02712","n_code_links":0,"syntology":null},{"paper":"/paper/hifuse-hierarchical-multi-scale-feature","title":"HiFuse: Hierarchical Multi-Scale Feature Fusion Network for Medical Image Classification","date":"2022-09-21","arxiv_id":"2209.10218","n_code_links":1,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/speech-recognition","name":"Speech Recognition","papers":13},{"task":"/task/speech-recognition-1","name":"speech-recognition","papers":12},{"task":"/task/automatic-speech-recognition-2","name":"Automatic Speech Recognition","papers":10},{"task":"/task/automatic-speech-recognition","name":"Automatic Speech Recognition (ASR)","papers":9},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":6},{"task":"/task/segmentation","name":"Segmentation","papers":5},{"task":"/task/object-detection","name":"Object Detection","papers":4},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":4},{"task":"/task/object-detection-1","name":"object-detection","papers":4},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":4},{"task":"/task/decoder","name":"Decoder","papers":3},{"task":null,"name":"GPU","papers":3},{"task":"/task/language-modeling","name":"Language Modeling","papers":3},{"task":"/task/language-modelling","name":"Language Modelling","papers":3},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":3},{"task":"/task/text-to-speech","name":"Text to Speech","papers":3},{"task":"/task/text-to-speech-1","name":"text-to-speech","papers":3},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":2},{"task":"/task/deep-learning","name":"Deep Learning","papers":2},{"task":"/task/image-classification","name":"Image Classification","papers":2}],"tasks_shown":20,"n_tasks":94,"usage_by_year":[{"year":"2018","papers":6},{"year":"2019","papers":4},{"year":"2020","papers":9},{"year":"2021","papers":5},{"year":"2022","papers":13},{"year":"2023","papers":8},{"year":"2024","papers":15},{"year":"2025","papers":4}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/hierarchical-feature-fusion"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}