SIGMOD 2011 论文导读(2011.7.7最后更新)

本文深入分析了SIGMOD2011年发表的两篇论文,一篇聚焦于使用MapReduce实现Theta-Join,另一篇则详细探讨了主内存HashJoin算法在多核CPU环境下的优化。文章不仅提供了理论分析,还通过实验验证了算法的有效性和实用性。

本博文记录我读过的SIGMOD 2011论文,一方面与大家分享,另一方面方便自己以后查找。

1) Processing Theta-Joins using MapReduce
Alper Okcan, Northeastern University; Mirek Riedewald*, Northeastern University

Theta-Join是Equijoin的超集(http://en.wikipedia.org/wiki/Relational_algebra#.CE.B8-join_and_equijoin)。简单来说,Equijoin的连接谓词是=,而Theta-Join的谓词则可以是{=,<,>,≤,≥}任一。使用MapReduce进行Equijoin很简单,而实现完全的Theta-Join支持是有难度的(因为<,>,≤,≥这样的偏序谓词与=有很大区别)。文章1) 提出一个基于reducer的代价模型和一个join模型,这两个模型简化了使用MapReducee实现Theta-Join算法的工作 2) 提出一种使用MapReduce进行Theta-Join的随机算法 3) 在2)的基础上针对一些常见输入给出优化。

Citations: [6] MapReduce原论文 [4][5][14][16][20] MapReduce Equijoin [19] MapReduce Non-equijoin [10] 并行join算法调研 [18] 一种并行Non-equijoin算法 (后面一段相关工作关于偏斜避免,略) 

因为和MapReduce、join有关所以扫了一下,但是Theta-Join现在不需要,因此没有细看。

2) Design and Evaluation of Main Memory Hash Join Algorithms for Multi-core CPUs
Spyros Blanas, University of Wisconsin; Yinan Li*, University of Wisconsin; Jignesh Patel, University of Wisconsin

文章比较了几种Hash Join算法,得出了基于共享式hash表的Hash Join算法是多核并行Hash Join算法中效率最高算法的结论。文章第3节可以当做很好的Hash Join教程,Hash Join的(Partition)(划分,partition不是必须的)-Build(建立hash表)-Probe(查hash表连接)三阶段讲得很透。related work里对hash join研究历史介绍详尽,非常适合刚进入相关领域研究的人。

Citations: [7] 主存数据库实现(SIGMOD 84,其中有hash join算法) [16] 利用cache处理关系操作(VLDB 94,包括hash join) [1][12] 对现代DBMS时间开销的构成进行仔细分析 [13] 一种基于主存的hash join优化 [15] 一种hash join优化,利用了cuckoo hashing算法(见14)与SIMD指令集 [9] 多线程并行hash join [10] hash算法在SQL Server中的应用 [8] 并行join中偏斜避免

我自己在研究RDF数据库时遇到的问题就是基于triple的存储在处理查询时需要进行大量的join操作。解决这个问题的一个方法是尽量减少join操作(通过不同的RDF存储模型,增加一些索引、缓存机制),另一个方法就是优化join算法。所以我对join算法优化相关的论文总是比较敏感。

Updated 2011.7.7 偏斜避免是并行join算法中的一个重要问题,1) 2)均有涉及。不过我还不够了解这方面的知识,有必要看一些相关文献。

转载于:https://www.cnblogs.com/mdyang/archive/2011/07/07/2099863.html

以前和大家分享过SIGMOD2009的论文,朋友们都很感兴趣,现手里有SIGMOD211的全部论文,再次和大家分享~ 一个包放不下,一共分成了3个包,包含百余篇论文,朋友们可以挑选自己感兴趣的部分下载,我尽量把文章目录写得明白一些。 这是第三部分 Emerging Trends in the Enterprise Data Analytics: Connecting Hadoop and DB2 Warehouse (Page 1161) Fatma Özcan (IBM Almaden Research Center) David Hoa (Silicon Valley Lab) Kevin S. Beyer (IBM Almaden Research Center) Andrey Balmin (IBM Almaden Research Center) Chuan Jie Liu (IBM China) Yu Li (IBM China) Efficient Processing of Data Warehousing Queries in a Split Execution Environment (Page 1165) Kamil Bajda-Pawlikowski (Hadapt Inc. & Yale University) Daniel J. Abadi (Hadapt Inc. & Yale University) Avi Silberschatz (Yale University) Erik Paulson (University of Wisconsin - Madison) SQL Server Column Store Indexes (Page 1177) Per-Åke Larson (Microsoft) Cipri Clinciu (Microsoft) Eric N. Hanson (Microsoft) Artem Oks (Microsoft) Susan L. Price (Microsoft) Srikumar Rangarajan (Microsoft) Aleksandras Surna (Microsoft) Qingqing Zhou (Microsoft) An Analytic Data Engine for Visualization in Tableau (Page 1185) Richard Wesley (Tableau Software) Matthew Eldridge (Tableau Software) Pawel Terlecki (Tableau Software) (Return to Top) Tutorials Learning Statistical Models from Relational Data (Page 1195) Lise Getoor (University of Maryland) Lilyana Mihalkova (University of Maryland) Web Data Management (Page 1199) Michael J. Cafarella (University of Michigan) Alon Y. Halevy (Google, Inc.) Privacy-Aware Data Management in Information Networks (Page 1201) Michael Hay (Cornell University) Kun Liu (Yahoo! Labs) Gerome Miklau (University of Massachusetts, Amherst) Jian Pei (Simon Fraser University) Evimaria Terzi (Boston University) Large-Scale Copy Detection (Page 1205) Xin Luna Dong (AT&T Labs-Research) Divesh Srivastava (AT&T Labs-Research) Data Management Over Flash Memory (Page 1209) Ioannis Koltsidas (IBM Research) Stratis D. Viglas (University of Edinburgh) Datalog and Emerging Applications: An Interactive Tutorial (Page 1213) Shan Shan Huang (LogicBlox, Inc.) Todd J. Green (University of California, Davis) Boon Thau Loo (University of Pennsylvania) (Return to Top) Demo Session 1: Systems and Performance One-Pass Data Mining Algorithms in a DBMS with UDFs (Page 1217) Carlos Ordonez (University of Houston) Sasi K. Pitchaimalai (University of Houston) Inspector Gadget: A Framework for Custom Monitoring and Debugging of Distributed Dataflows (Page 1221) Christopher Olston (Yahoo! Research) Benjamin Reed (Yahoo! Research) RAFT at Work: Speeding-Up MapReduce Applications Under Task and Node Failures (Page 1225) Jorge-Arnulfo Quiané-Ruiz (Saarland University) Christoph Pinkel (Saarland University) Jörg Schad (Saarland University) Jens Dittrich (Saarland University) WattDB: An Energy-Proportional Cluster of Wimpy Nodes (Page 1229) Daniel Schall (TU Kaiserslautern) Volker Hudlet (TU Kaiserslautern) BRRL: A Recovery Library for Main-Memory Applications in the Cloud (Page 1233) Tuan Cao (Cornell University) Benjamin Sowell (Cornell University) Marcos Vaz Salles (Cornell University) Alan Demers (Cornell University) Johannes Gehrke (Cornell University) A Data-Oriented Transaction Execution Engine and Supporting Tools (Page 1237) Ippokratis Pandis (Carnegie Mellon University & École Polytechnique Fédérale de Lausanne) Pinar Tözün (École Polytechnique Fédérale de Lausanne) Miguel Branco (École Polytechnique Fédérale de Lausanne) Dimitris Karampinas (University of Patras) Danica Porobic (École Polytechnique Fédérale de Lausanne) Ryan Johnson (University of Toronto) Anastasia Ailamaki (École Polytechnique Fédérale de Lausanne & Carnegie Mellon University) iGraph in Action: Performance Analysis of Disk-Based Graph Indexing Techniques (Page 1241) Wook-Shin Han (Kyungpook National University) Minh-Duc Pham (Kyungpook National University) Jinsoo Lee (Kyungpook National University) Romans Kasperovics (Kyungpook National University) Jeffrey Xu Yu (Chinese University of Hong Kong) StreamRec: A Real-Time Recommender System (Page 1243) Badrish Chandramouli (Microsoft Research) Justin J. Levandoski (University of Minnesota) Ahmed Eldawy (University of Minnesota) Mohamed F. Mokbel (University of Minnesota) (Return to Top) Demo Session 2: Ranking, the Web, and Social Media SkylineSearch: Semantic Ranking and Result Visualization for PubMed (Page 1247) Julia Stoyanovich (University of Pennsylvania) Mayur Lodha (Columbia University) William Mee (Columbia University) Kenneth A. Ross (Columbia University) A Cross-Service Travel Engine for Trip Planning (Page 1251) Gang Chen (Zhejiang University) Chen Liu (National University of Singapore) Meiyu Lu (National University of Singapore) Beng Chin Ooi (National University of Singapore) Shanshan Ying (National University of Singapore) Anthony K. H. Tung (National University of Singapore) Dongxiang Zhang (National University of Singapore) Meihui Zhang (National University of Singapore) WINACS: Construction and Analysis of Web-Based Computer Science Information Networks (Page 1255) Tim Weninger (University of Illinois Urbana-Champaign) Marina Danilevsky (University of Illinois Urbana-Champaign) Fabio Fumarola (Universitá degli Studi di Bari) Joshua Hailpern (University of Illinois Urbana-Champaign) Jiawei Han (University of Illinois Urbana-Champaign) Thomas J. Johnston (University of Illinois Urbana-Champaign) Surya Kallumadi (Kansas State University) Hyungsul Kim (University of Illinois Urbana-Champaign) Zhijin Li (University of Illinois Urbana-Champaign) David McCloskey (University of Illinois Urbana-Champaign) Yizhou Sun (University of Illinois Urbana-Champaign) Nathan E. TeGrotenhuis (Whitworth University) Chi Wang (University of Illinois Urbana-Champaign) Xiao Yu (University of Illinois Urbana-Champaign) Tweets as Data: Demonstration of TweeQL and TwitInfo (Page 1259) Adam Marcus (Massachusetts Institute of Technology) Michael S. Bernstein (Massachusetts Institute of Technology) Osama Badar (Massachusetts Institute of Technology) David R. Karger (Massachusetts Institute of Technology) Samuel Madden (Massachusetts Institute of Technology) Robert C. Miller (Massachusetts Institute of Technology) MOBIES: Mobile-Interface Enhancement Service for Hidden Web Database (Page 1263) Xin Jin (George Washington University) Aditya Mone (University of Texas at Arlington) Nan Zhang (George Washington University) Gautam Das (University of Texas at Arlington) Search Computing: Multi-Domain Search on Ranked Data (Page 1267) Alessandro Bozzon (Politecnico di Milano) Daniele Braga (Politecnico di Milano) Marco Brambilla (Politecnico di Milano) Stefano Ceri (Politecnico di Milano) Francesco Corcoglioniti (Politecnico di Milano) Piero Fraternali (Politecnico di Milano) Salvatore Vadacca (Politecnico di Milano) EnBlogue - Emergent Topic Detection in Web 2.0 Streams (Page 1271) Foteini Alvanaki (Saarland University) Michel Sebastian (Saarland University) Krithi Ramamritham (IIT Bombay) Gerhard Weikum (Max-Planck Institute Informatics) NOAM: News Outlets Analysis and Monitoring System (Page 1275) Ilias Flaounas (University of Bristol) Omar Ali (University of Bristol) Marco Turchi (European Commission) Tristan Snowsill (University of Bristol) Florent Nicart (Université de Rouen) Tijl De Bie (University of Bristol) Nello Cristianini (University of Bristol) (Return to Top) Demo Session 3: Data Integration and Probabilistic Databases Pay-As-You-Go Mapping Selection in Dataspaces (Page 1279) Cornelia Hedeler (The University of Manchester) Khalid Belhajjame (The University of Manchester) Norman W. Paton (The University of Manchester) Alvaro A. A. Fernandes (The University of Manchester) Suzanne M. Embury (The University of Manchester) Lu Mao (The University of Manchester) Chenjuan Guo (The University of Manchester) Exelixis: Evolving Ontology-Based Data Integration System (Page 1283) Haridimos Kondylakis (FORTH-ICS) Dimitris Plexousakis (FORTH-ICS) U-MAP: A System for Usage-Based Schema Matching and Mapping (Page 1287) Hazem Elmeleegy (AT&T Labs - Research) Jaewoo Lee (Purdue University) El Kindi Rezig (Purdue University) Mourad Ouzzani (Purdue University) Ahmed Elmagarmid (Qatar Computing Research Institute, Qatar Foundation) The System T IDE: An Integrated Development Environment for Information Extraction Rules (Page 1291) Laura Chiticariu (IBM Research - Almaden) Vivian Chu (IBM research - Almaden) Sajib Dasgupta (IBM Research - Almaden) Thilo W. Goetz (IBM Software - Germany) Howard Ho (IBM Research - Almaden) Rajasekar Krishnamurthy (IBM Research - Almaden) Alexander Lang (IBM Software - Germany) Yunyao Li (IBM Research - Almaden) Bin Liu (University of Michigan) Frederick R. Reiss (IBM Research - Almaden) Shivakumar Vaithyanathan (IBM Research - Almaden) Huaiyu Zhu (IBM Research - Almaden) ProApproX: A Lightweight Approximation Query Processor over Probabilistic Trees (Page 1295) Pierre Senellart (Institut Télécom; Télécom ParisTech) Asma Souihli (Institut Télécom; Télécom ParisTech) SPROUT²: A Squared Query Engine for Uncertain Web Data (Page 1299) Robert Fink (University of Oxford) Andrew Hogue (Google Inc.) Dan Olteanu (University of Oxford) Swaroop Rath (University of Oxford) Fuzzy Prophet: Parameter Exploration in Uncertain Enterprise Scenarios (Page 1303) Oliver Kennedy (École Polytechnique Fédérale de Lausanne) Steve Lee (Microsoft Corporation) Charles Loboz (Microsoft Corporation) Slawek Smyl (Microsoft Corporation) Suman Nath (Microsoft Research) LinkDB: A Probabilistic Linkage Database System (Page 1307) Ekaterini Ioannou (Technical University of Crete) Wolfgang Nejdl (L3S Research Center) Claudia Niederée (L3S Research Center) Yannis Velegrakis (University of Trento) (Return to Top) Demo Session 4: User Support and Development Environments CONFLuEnCE: CONtinuous workFLow ExeCution Engine (Page 1311) Panayiotis Neophytou (University of Pittsburgh) Panos K. Chrysanthis (University of Pittsburgh) Alexandros Labrinidis (University of Pittsburgh) Demonstration of Qurk: A Query Processor for Human Operators (Page 1315) Adam Marcus (Massachusetts Institute of Technology) Eugene Wu (Massachusetts Institute of Technology) David R. Karger (Massachusetts Institute of Technology) Samuel Madden (Massachusetts Institute of Technology) Robert C. Miller (Massachusetts Institute of Technology) Automatic Example Queries for Ad Hoc Databases (Page 1319) Bill Howe (University of Washington) Garret Cole (University of Washington) Nodira Khoussainova (University of Washington) Leilani Battle (University of Washington) (Return to Top) NetTrails: A Declarative Platform for Maintaining and Querying Provenance in Distributed Systems (Page 1323) Wenchao Zhou (University of Pennsylvania) Qiong Fei (University of Pennsylvania) Shengzhi Sun (University of Pennsylvania) Tao Tao (University of Pennsylvania) Andreas Haeberlen (University of Pennsylvania) Zachary Ives (University of Pennsylvania) Boon Thau Loo (University of Pennsylvania) Micah Sherr (Georgetown University) GBLENDER: Visual Subgraph Query Formulation Meets Query Processing (Page 1327) Changjiu Jin (Nanyang Technological University) Sourav S. Bhowmick (Nanyang Technological University) Xiaokui Xiao (Nanyang Technological University) Byron Choi (Hong Kong Baptist University) Shuigeng Zhou (Fudan University) Coordination Through Querying in the Youtopia System (Page 1331) Nitin Gupta (Cornell University) Lucja Kot (Cornell University) Gabriel Bender (Cornell University) Sudip Roy (Cornell University) Johannes Gehrke (Cornell University) Christoph Koch (École Polytechnique Fédérale de Lausanne) DBWiki: A Structured Wiki for Curated Data and Collaborative Data Management (Page 1335) Peter Buneman (University of Edinburgh) James Cheney (University of Edinburgh) Sam Lindley (University of Edinburgh) Heiko Müller (CSIRO) Rapid Development of Web-Based Query Interfaces for XML Datasets with QURSED (Page 1339) Abhijith Kashyap (SUNY at Buffalo) Michalis Petropoulos (SUNY at Buffalo)
源码直接下载地址: https://pan.quark.cn/s/d280357b18e5 在网页构建领域中,HTML5被视为当代网页工程的基础规范,其问世显著增强了页面的视觉表现力与用户互动性。本工程致力于运用HTML5技术开发一个电视剧信息展示页面,目的是呈现诸如剧名、演员构成、故事梗概等电视剧关键资料。接下来将深入阐释如何借助HTML5的结构化组件和样式管理功能达成此项目目标。 我们必须掌握HTML5的核心框架。一个规范的HTML5文档一般包含`<!DOCTYPE html>`声明、`<html>`根标记、`<head>`头部标记和`<body>`主体标记。在头部区域,可以配置网页的基本元数据,例如字符集设定、页面标题等。在主体部分,将具体构建电视剧信息列表的内容。 电视剧展示页面通常包含多个条目,每个条目对应一部电视剧。HTML5中的`<section>`标记用于内容模块化,适合表示单个电视剧的详细信息区域。每个`<section>`内部,可使用`<h2>`标题标记显示剧名,`<img>`图像标记插入宣传剧照,`<p>`段落标记呈现剧情介绍,而`<ul>`无序列表与`<li>`列表项标记则用于罗列演员阵容。 为了优化页面布局,需要借助CSS(层叠样式表)进行样式管理。HTML5引入了创新的CSS选择器与布局模型,例如Flexbox和Grid,使页面布局更加灵活多变。在此场景下,可以利用Flexbox为电视剧信息列表实现自适应布局,保障在不同设备尺寸下均能呈现理想视觉效果。具体操作时,可将`<section>`标记设定为Flex容器,通过`display: flex;`属性,并运用`justify-content`和`align-items`属性调整子元素的对...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值