データ型 - (A)のハイブ基本的な使い方
1.ハイブ基本データ型
ハイブデータ型 | Javaデータ型 | 長さ | 例 |
---|---|---|---|
TINYINT | バイト | 1バイトの符号付き整数 | 20 |
SMALINT | ショート | 2バイトの符号付き整数 | 20 |
INT | int型 | 4バイトの符号付き整数 | 20 |
BIGINT | 長いです | 8バイトの符号付き整数 | 20 |
BOOLEAN | ブーリアン | trueまたはfalseのブール、 | 真偽 |
浮く | 浮く | 単精度浮動小数点数 | 3.14159 |
ダブル | ダブル | 倍精度浮動小数点数 | 3.14159 |
STRING | 弦 | キャラクターシリーズ。あなたは、文字セットを指定することができます。あなたは、単一引用符または二重引用符を使用することができます。 | 「すべての良い男性のための」「今の時間です」 |
TIMESTAMP | タイムタイプ | ||
バイナリ | バイト配列 |
注:それは文字の数まで保持できる宣言することはできません文字列型の変数であるVARCHARタイプのデータベース、のString型と同等のハイブについては、しかし、理論的には、それは文字の2ギガバイトを格納することができます。
データ型の2コレクション
データの種類 | 説明 | 構文例 |
---|---|---|
STRUCT | そして、類似したC言語の構造体は、「ドット」表記アクセス元素含有量から入手できます。列のデータ・タイプがSTRUCT {最初の文字列、最後STRING}である場合、例えば、最初素子1は1次回フィールドで参照することができます。 | 構造体()例如構造体<ストリート:文字列、市:文字列> |
地図 | MAPは、キーの集合である - 配列表記を使用して値の組は、データにアクセスすることができます。カラムのデータ型がMAP、前記キーがある場合、例えば、 - >「ジョン」と「最後」 - - >値のペアが「最初」である>「ドウ」、それは姓フィールドによって得ることができる[「最終」]要素 | 地図()例えば地図<文字列、整数> |
アレイ | 配列は、同じ名前と型を持つ変数の集まりです。これらの変数は、配列の要素と呼ばれ、各配列要素は数、ゼロから番号を付しています。例えば、[「ジョン」、「ドゥ」]の配列値が、第2の要素は、配列の名前で参照することができる[1]。 | アレイ()配列例えば
|
複雑なデータハイブのARRAY、MAPおよびSTRUCTの3つのタイプがあります。MAPのマップ配列等が挙げられ、C言語STRUCT構造体の配列とJavaは、同様に、それは名前付きフィールドのコレクションをカプセル化し、複雑なデータ型は、ネストの任意のレベルを可能にします。
3.ケースの実用的な操作
1)ハイブにアクセスし、我々は、そのデータ構造の形式を表すためにJSON形式を使用し、行の次の表を仮定
{
"name": "songsong",
"friends": ["bingbing" , "lili"] , //列表Array,
"children": { //键值Map,
"xiao song": 18 ,
"xiaoxiao song": 19
}
"address": { //结构Struct,
"street": "hui long guan" ,
"city": "beijing"
}
}
2)上記のデータ構造に基づいて、我々は、対応するハイブ内のテーブル、およびインポートデータを作成しました
次のようにローカルテストファイルtest.txtの作成、読み取ります。
songsong,bingbing_lili,xiao song:18_xiaoxiao song:19,hui long guan_beijing
yangyang,caicai_susu,xiao yang:18_xiaoxiao yang:19,chao yang_beijing
3)ハイブshujujiegouテストテーブルを作成します
create table test(
name string,
friends array<string>,
children map<string, int>,
address struct<street:string, city:string>
)
row format delimited fields terminated by ','
collection items terminated by '_'
map keys terminated by ':'
lines terminated by '\n';
字段解释:
row format delimited fields terminated by ',' -- 列分隔符
collection items terminated by '_' --MAP STRUCT 和 ARRAY 的分隔符(数据分割符号)
map keys terminated by ':' -- MAP中的key与value的分隔符
lines terminated by '\n'; -- 行分隔符
4)試験テーブルにテキストデータに変換します
hive (default)> load data local inpath ‘/opt/module/datas/test.txt’into table test
5)データの三種類の列のセットにアクセスする、それぞれ、次のアクセス方法ARRAY、MAPのSTRUCT
hive (default)> select friends[1],children['xiao song'],address.city from test
where name="songsong";
OK
_c0 _c1 city
lili 18 beijing
Time taken: 0.076 seconds, Fetched: 1 row(s)
4.データ型変換
ハイブアトミックデータ型が暗黙的な変換は、int型の式を用いて、例えば、Java型変換と同様とすることができるされ、INT TINYINTは自動的に型に変換ではなく、ハイブ逆変換、例えば、式、INTが自動的TINYINT型に変換されませんTINYINT型を使用し、それがCAST操作しない限り、エラーを返します。
(1)暗黙的型変換ルールを次のように
1)任意の整数タイプは、暗黙的に、そのようなTINYINTとして、タイプの広い範囲に変換することができるINTに変換することができ、INTはBIGINTに変換することができます。
2)すべての整数型、FLOATとSTRINGタイプはDOUBLEに暗黙的に変換することができます。
3)TINYINT、SMALLINT、INTはfloatに変換することができます。
4)BOOLEANタイプは他のタイプに変換することができません。
(2)CAST操作表示データ型変換を使用することができます
(INT AS '1')例えばCASTは、整数1に文字列を '1' を使用して、キャストが失敗した場合、CAST(INT AS 'X')として実行、式はNULL、NULLを返します。
0: jdbc:hive2://hadoop102:10000> select '1'+2, cast('1'as int) + 2;
+------+------+--+
| _c0 | _c1 |
+------+------+--+
| 3.0 | 3 |
+------+------+--+