美文网首页玩转大数据大数据
Hive 的 left semi join 讲解

Hive 的 left semi join 讲解

作者: 坨坨的大数据 | 来源:发表于2021-12-16 09:41 被阅读0次

    介绍

    LEFT SEMI JOIN (左半连接)是 IN/EXISTS 子查询的一种更高效的实现。

    示例

    SELECT A.KEY,A.VALUE
    FROM A
    WHERE A.KEY IN(SELECT B.KEY FROM B)
    

    可以改写为

    SELECT A.KEY,A.VAL
    FROM A LEFT SEMI JOIN B
    ON (A.KEY = B.KEY)
    

    特点

    1、left semi join 的限制是, JOIN 子句中右边的表只能在 ON 子句中设置过滤条件,在 WHERE 子句、SELECT 子句或其他地方过滤都不行。

    2、left semi join 是只传递表的 join key 给 map 阶段,因此left semi join 中最后 select 的结果只许出现左表。

    3、因为 left semi join 是 in(keySet) 的关系,遇到右表重复记录,左表会跳过,而 join 则会一直遍历。这就导致右表有重复值得情况下 left semi join 只产生一条,join 会产生多条,也会导致 left semi join 的性能更高。

    比如以下A表和B表进行 join 或 left semi join,然后 select 出所有字段,结果区别如下:


    image.png

    注意:蓝色叉的那一列实际是不存在left semi join中的,因为最后 select 的结果只许出现左表。

    相关文章

      网友评论

        本文标题:Hive 的 left semi join 讲解

        本文链接:https://www.haomeiwen.com/subject/tumaxrtx.html