Proceedings of the Vldb Endowment

Papers
(The median citation count of Proceedings of the Vldb Endowment is 3. The table below lists those papers that are above that threshold based on CrossRef citation counts [max. 250 papers]. The publications cover those that have been published in the past four years, i.e., from 2022-08-01 to 2026-08-01.)
ArticleCitations
IsoBugView240
Cardinality Estimation for Having-Clauses192
Shifting Transaction Isolation on Graphs: From Systems to Data145
Efficient Discovery of Relaxed Functional Dependencies134
QPJVis Demo: Quality-Boost Progressive Join Query Processing System118
ConANN: Conformal Approximate Nearest Neighbor Search104
DyHealth89
Solver-In-The-Loop Cluster Resource Management for Database-as-a-Service81
Resilience-Aware Elastic Scaling for Cloud-Native Online DL Training on Multi-Tenant GPU Clusters80
TRIM: An Efficient Framework for Exact Eccentricity Computation on Large-Scale Graphs79
Approximating probabilistic group steiner trees in graphs77
VeriBench: Analyzing the Performance of Database Systems with Verifiability76
Cloudy with a Chance of JSON73
Privacy for Free: Leveraging Local Differential Privacy Perturbed Data from Multiple Services69
Efficient Graph Data Access for Out-of-Memory GPU Streaming Graph Processing68
Timestamp as a Service, Not an Oracle67
PARQO: Penalty-Aware Robust Plan Selection in Query Optimization67
DuckDB-wasm66
Relational Data Models for Genetic VCF data66
Unraveling the Impact of Window Semantics: Optimizing Join Order for Efficient Stream Processing65
Differentially Private Stream Processing at Scale60
Opportunities for Quantum Acceleration of Databases: Optimization of Queries and Transaction Schedules60
Spectrum: Speedy and Strictly-Deterministic Smart Contract Transactions for Blockchain Ledgers59
Influential Community Search over Large Heterogeneous Information Networks59
Fries56
A Reproducible Tutorial on Reproducibility in Database Systems Research55
Neighborhood-Based Hypergraph Core Decomposition52
Efficient Distributed Transaction Processing in Heterogeneous Networks50
OmniSketch: Efficient Multi-Dimensional High-Velocity Stream Analytics with Arbitrary Predicates49
GaussDB: A Cloud-Native Multi-Primary Database with Compute-Memory-Storage Disaggregation48
Galvatron47
SemBench: A Benchmark for Semantic Query Processing Engines47
SkyStore: Cost-Optimized Object Storage Across Regions and Clouds47
Motiflets47
Unify: A System For Unstructured Data Analytics46
Accelerating Subgraph Matching through Fine-Grained and Powerful Equivalences44
How to Optimize SQL Queries? A Comparison Between Split, Holistic, and Hybrid Approaches44
TSB-AutoAD: Towards Automated Solutions for Time-Series Anomaly Detection43
Towards Designing and Learning Piecewise Space-Filling Curves42
POEM41
LION: Fast and High-Resolution Network Kernel Density Visualization41
DoppelGanger++ in Action: A Database Replay System with Fast Dependency Graph Generation41
Breathing New Life into an Old Tree: Resolving Logging Dilemma of B + -tree on Modern Computational Storage Drives41
Exploiting the Power of Equality-Generating Dependencies in Ontological Reasoning40
Demonstrating Waffle: A Self-Driving Grid Index39
Hardware-Efficient Data Imputation through DBMS Extensibility39
Efficient Non-Learning Similar Subtrajectory Search39
DARKER: Efficient Transformer with Data-Driven Attention Mechanism for Time Series39
SUFF: Accelerating Subgraph Matching with Historical Data38
Trie memtables in cassandra38
SQL Engines Excel at the Execution of Imperative Programs37
Making CRDTs Not So Eventual37
LogLite: Lightweight Plug-and-Play Streaming Log Compression37
LiBox: A Learned Index as an Array to Minimize Last-Mile Search37
PSFQ: A Blockchain-Based Privacy-Preserving and Verifiable Student Feedback Questionnaire Platform37
Federated Data Distribution Shift Estimation37
TPCx-AI under the Microscope: A Benchmarking Debt Analysis37
SAIL: A Voyage to Symbolic Approximation Solutions for Time-Series Analysis37
IsoVista: Black-Box Checking Database Isolation Guarantees36
Eureka: Enabling Fine-Grained Access and Range Queries on Compressed Scientific Data via Data-Index Co-Compression36
Approximate Queries over Concurrent Updates35
Fast Verification of Strong Database Isolation35
HyperBlocker: Accelerating Rule-Based Blocking in Entity Resolution Using GPUs35
LITS: An Optimized Learned Index for Strings34
Cuckoo Heavy Keeper and the Balancing Act of Maintaining Heavy Hitters in Stream Processing34
bNDCRepair: Cleaning both Data Errors and Inaccurate Constraints on Numerical Sequential Data34
Seiden: Revisiting Query Processing in Video Database Systems34
FairDAG: Consensus Fairness over Multi-Proposer Causal Design34
Bonspiel: Low Tail Latency Transactions in Geo-Distributed Databases34
DPXPlain34
TsQuality: Measuring Time Series Data Quality in Apache IoTDB33
Hermes: Off-the-Shelf Real-Time Transactional Analytics33
LIDER33
HAIChart: Human and AI Paired Visualization System33
LIO: A Lightweight and Interpretable Query Optimizer based on an Evolutionary Forest33
VeLP: Vehicle Loading Plan Learning from Human Behavior in Nationwide Logistics System31
Dealing with Acronyms, Abbreviations, and Typos in Real-World Entity Matching31
A Comprehensive Survey and Experimental Study of Learning-Based Community Search31
SingleStore-V: An Integrated Vector Database System in SingleStore31
A demonstration of multi-region CockroachDB31
Databases Unbound: Querying All of the World's Bytes with AI31
Scalable Reasoning on Document Stores via Instance-Aware Query Rewriting31
Vive la Différence: Practical Diff Testing of Stateful Applications30
GalaxyWeaver: Autonomous Table-to-Graph Conversion and Schema Optimization with Large Language Models30
SparkCAD30
HADES: Range-Filtered Private Aggregation on Public Data30
FSMDTW: A Fast Index-Free Subsequence Matching Algorithm for Dynamic Time Warping30
A Practical Theory of Generalization in Selectivity Learning30
FastMosaic in Action: A New Mosaic Operator for Array DBMSs29
LavaStore: ByteDance's Purpose-Built, High-Performance, Cost-Effective Local Storage Engine for Cloud Services29
Less is More: Efficient Time Series Dataset Condensation via Two-Fold Modal Matching29
Scalable GPU Acceleration of Scalar Functions in Analytical Databases: Compilation, Benchmarking, and Optimization28
KGNav: A Knowledge Graph Navigational Visual Query System27
FARGO: Fast Maximum Inner Product Search via Global Multi-Probing27
Discovering Leitmotifs in Multidimensional Time Series27
Petabyte-Scale Row-Level Operations in Data Lakehouses27
Oasis: An Optimal Disjoint Segmented Learned Range Filter27
DINOMO26
Learned Static Function Data Structures26
Efficient and Accurate SimRank-Based Similarity Joins: Experiments, Analysis, and Improvement26
CMixing: An Efficient Coin Mixing Platform to Enhance Anonymity in Cryptocurrency Transactions26
Enabling Index-Free Adjacency in Oblivious Graph Processing with Delayed Duplications26
FS-Real: A Real-World Cross-Device Federated Learning Platform26
Decentralized Actor Scheduling and Reference-Based Storage in Xorbits: A Native Scalable Data Science Engine26
Efficient Approximation of Certain and Possible Answers for Ranking and Window Queries over Uncertain Data26
Win-Win: On Simultaneous Clustering and Imputing over Incomplete Data26
ContTune: Continuous Tuning by Conservative Bayesian Optimization for Distributed Stream Data Processing Systems26
Enriching Relations with Additional Attributes for ER26
Biathlon: Harnessing Model Resilience for Accelerating ML Inference Pipelines26
XDB in Action: Decentralized Cross-Database Query Processing for Black-Box DBMSes26
From Zero to Hero: Detecting Leaked Data through Synthetic Data Injection and Model Querying26
Kora: A Cloud-Native Event Streaming Platform for Kafka25
TATA: An Efficient Framework for Task Transfer in Query Plan Representation25
MLP-Mixer based Masked Autoencoders are Effective, Explainable and Robust for Time Series Anomaly Detection25
VIDEX: A Disaggregated and Extensible Virtual Index for the Cloud and AI Era25
OneProvenance: Efficient Extraction of Dynamic Coarse-Grained Provenance from Database Query Event Logs25
Navigating Data Repositories: Utilizing Line Charts to Discover Relevant Datasets25
Sphinteract: Resolving Ambiguities in NL2SQL through User Interaction25
Instance-Optimal Acyclic Join Processing Without Regret: Engineering the Yannakakis Algorithm in Column Stores24
CoroGraph: Bridging Cache Efficiency and Work Efficiency for Graph Algorithm Execution24
Sparcle: Boosting the Accuracy of Data Cleaning Systems through Spatial Awareness24
DBAIOps: A Reasoning LLM-Enhanced Database Operation and Maintenance System using Knowledge Graphs24
Expanding Reverse Nearest Neighbors24
BURST: Rendering Clustering Techniques Suitable for Evolving Streams24
Dalton24
RICH: Real-Time Identification of Negative Cycles for High-Efficiency Arbitrage24
Saving Money for Analytical Workloads in the Cloud23
Optimal Sharding for Scalable Blockchains with Deconstructed SMR23
ETC: Efficient Training of Temporal Graph Neural Networks over Large-Scale Dynamic Graphs23
ACTA: Autonomy and Coordination Task Assignment in Spatial Crowdsourcing Platforms23
Simulating a Transactional Server for Multi-Model Systems23
Enhancing Accuracy for Super Spreader Identification in High-Speed Data Streams23
ALECE: An Attention-based Learned Cardinality Estimator for SPJ Queries on Dynamic Workloads23
Unleash the Power of Ellipsis: Accuracy-Enhanced Sparse Vector Technique with Exponential Noise22
Window Function Expression: Let the Self-Join Enter22
Demo of QueryBooster: Supporting Middleware-Based SQL Query Rewriting as a Service22
Starry22
From Scale-Up to Scale-Out: PolarDB's Journey to Achieving 2 Billion tpmC22
CORE-Sketch: On Exact Computation of Median Absolute Deviation with Limited Space22
QuoteInspector: Gaining Insight about Social Media Discussions22
Pyneapple-G: Scalable Spatial Grouping Queries22
RCRank: Multimodal Ranking of Root Causes of Slow Queries in Cloud Database Systems22
TuskFlow: An Efficient Graph Database for Long-Running Transactions22
Cloud data systems22
Toward Quantity-of-Interest Preserving Lossy Compression for Scientific Data22
Fused Gromov-Wasserstein Alignment for Graph Edit Distance Computation and Beyond22
Hybrid Mixed Integer Linear Programming for Large-Scale Join Order Optimisation22
CEDA: Learned Cardinality Estimation with Domain Adaptation21
Authenticated Aggregate Queries with Boolean Range Predicates on Blockchains21
Resource Management in Aurora Serverless21
On More Efficiently and Versatilely Querying Historical k -Cores21
Computing Rule-Based Explanations by Leveraging Counterfactuals21
Minimum Strongly Connected Subgraph Collection in Dynamic Graphs21
GENTI: GPU-Powered Walk-Based Subgraph Extraction for Scalable Representation Learning on Dynamic Graphs21
Quantifying Point Contributions: A Lightweight Framework for Efficient and Effective Query-Driven Trajectory Simplification21
Accelerating Maximal Clique Enumeration via Graph Reduction21
Polyglot data management21
Datamap-Driven Tabular Coreset Selection for Classifier Training21
Efficient Fault Tolerance for Recommendation Model Training via Erasure Coding21
GQL and SQL/PGQ: Theoretical Models and Expressive Power20
DAFDiscover: Robust Mining Algorithm for Dynamic Approximate Functional Dependencies on Dirty Data20
A Case for Graphics-Driven Query Processing20
TimeCSL: Unsupervised Contrastive Learning of General Shapelets for Explorable Time Series Analysis20
ResLake : Towards Minimum Job Latency and Balanced Resource Utilization in Geo-Distributed Job Scheduling20
L2chain20
Uldp-FL: Federated Learning with Across-Silo User-Level Differential Privacy20
Falcon: Advancing Asynchronous BFT Consensus for Lower Latency and Enhanced Throughput20
Towards Efficient Random-Order Enumeration for Join Queries20
SCompression: Enhancing Database Knob Tuning Efficiency Through Slice-Based OLTP Workload Compression20
Saturn: An Optimized Data System for Multi-Large-Model Deep Learning Workloads20
DPSUR: Accelerating Differentially Private Stochastic Gradient Descent Using Selective Update and Release19
Efficient Discovery of Significant Patterns with Few-Shot Resampling19
QTCS: Efficient Query-Centered Temporal Community Search19
DBMS annihilator19
OceanBase Paetica: A Hybrid Shared-Nothing/Shared-Everything Database for Supporting Single Machine and Distributed Cluster19
Active Data Lakes: Regaining Physical Data Independence Without Losing Interoperability19
Combining Small Language Models and Large Language Models for Zero-Shot NL2SQL19
To UDFs and Beyond: Demonstration of a Fully Decomposed Data Processor for General Data Wrangling Tasks19
YeSQL19
Efficient Triangle-Connected Truss Community Search in Dynamic Graphs19
Cents: A Flexible and Cost-Effective Framework for LLM-Based Table Understanding19
Nuhuo: An Effective Estimation Model for Traffic Speed Histogram Imputation on A Road Network19
AeonG: An Efficient Built-in Temporal Support in Graph Databases19
Task: An Efficient Framework for Instant Error-Tolerant Spatial Keyword Queries on Road Networks19
Mix & Match: Subgraph Matching for Absolute Coverage19
Tigger: A Database Proxy That Bounces with User-Bypass19
KEIGO: Co-Designing Log-Structured Merge Key-Value Stores with a Non-Volatile, Concurrency-Aware Storage Hierarchy18
ArcheType: A Novel Framework for Open-Source Column Type Annotation Using Large Language Models18
Efficient k NN Search in Public Transportation Networks18
DataRinse: Semantic Transforms for Data Preparation Based on Code Mining18
Machine Learning for Graph Data Management and Query Processing18
Simpler is More: Efficient Top-K Nearest Neighbors Search on Large Road Networks18
Analyzing Near-Network Hardware Acceleration with Co-Processing on DPUs18
Ganos Aero: A Cloud-Native System for Big Raster Data Management and Processing18
Bridging Disciplines in Data Management Research to Solve Complex Data Problems18
Composable Data Management: An Execution Overview18
Anarchy in the Database: A Survey and Evaluation of Database Management System Extensibility18
Scalable and Robust Snapshot Isolation for High-Performance Storage Engines18
GRewriter: Practical Query Rewriting with Automatic Rule Set Expansion in GaussDB18
Differentially Private Data Generation with Missing Data17
Efficient Algorithms for Pseudoarboricity Computation in Large Static and Dynamic Graphs17
Lingua Manga : A Generic Large Language Model Centric System for Data Curation17
PIM-Tree17
ELPIS: Graph-Based Similarity Search for Scalable Data Science17
Fast approximate denial constraint discovery17
Dynamic Graph Databases with Out-of-Order Updates17
TUX: Efficient Drop-in Networking for Database Systems17
Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes17
ELEET: Efficient Learned Query Execution over Text and Tables17
Vortex: Overcoming Memory Capacity Limitations in GPU-Accelerated Large-Scale Data Analytics17
PRICE: A Pretrained Model for Cross-Database Cardinality Estimation17
QStore: Quantization-Aware Compressed Model Storage17
The case for distributed shared-memory databases with RDMA-enabled memory disaggregation17
Vodka: Rethink Benchmarking Philosophy in HTAP Systems17
LOGER: A Learned Optimizer Towards Generating Efficient and Robust Query Execution Plans17
MiCS17
Themis: A GPU-Accelerated Relational Query Execution Engine17
FlowWalker: A Memory-Efficient and High-Performance GPU-Based Dynamic Graph Random Walk Framework16
Bringing the Operational and Analytical Worlds Together with Lakebase16
ImDiffusion: Imputed Diffusion Models for Multivariate Time Series Anomaly Detection16
TIGER: Training Inductive Graph Neural Network for Large-Scale Knowledge Graph Reasoning16
A Hierarchical Grouping Algorithm for the Multi-Vehicle Dial-a-Ride Problem16
Explaining Differentially Private Query Results with DPXPlain16
Efficient GNN Training on Giant Graphs with Collective Batching and Scheduling16
Streaming Time Series Subsequence Anomaly Detection: A Glance and Focus Approach16
B link -hash: An Adaptive Hybrid Index for In-Memory Time-Series Databases16
Reimagining Deep Learning Systems through the Lens of Data Systems16
OFL-W3: A One-Shot Federated Learning System on Web 3.016
Efficient Black-Box Checking of Snapshot Isolation in Databases16
Access Control for Information-Theoretically Secure Data16
Incremental Detection of Denial Constraint Violations16
Fair Transaction Processing for Multi-Tenant Databases16
AMRAS16
ChainDash: An Ad-Hoc Blockchain Data Analytics System16
Elastic Index Selection for Label-Hybrid AKNN Search16
POEM: Pattern-Oriented Explanations of Convolutional Neural Networks16
Improving DBMS Scheduling Decisions with Accurate Performance Prediction on Concurrent Queries16
SecretFlow-SCQL: A Secure Collaborative Query Platform15
Exploiting Cloud Object Storage for High-Performance Analytics15
MD-MVCC: Multi-Version Concurrency Control for Schema Changes in Azure SQL Database15
Towards Principled, Practical Document Database Design15
Cracking Vector Search Indexes15
Heta: Distributed Training of Heterogeneous Graph Neural Networks15
Generating Succinct Descriptions of Database Schemata for Cost-Efficient Prompting of Large Language Models15
Design and Modular Verification of Distributed Transactions in MongoDB15
Machine Learning for Subgraph Extraction: Methods, Applications and Challenges15
An Experimental Evaluation of Anomaly Detection in Time Series15
Database Views as Explanations for Relational Deep Learning15
NeutronStream: A Dynamic GNN Training Framework with Sliding Window for Graph Streams15
OpenFGL: A Comprehensive Benchmark for Federated Graph Learning15
0.13169288635254