Apache Zeppelin 安装指南:从二进制包部署、源码构建到服务化管理 后端前端大数据数据分析【免费下载链接】zeppelinWeb-based notebook that enables>项目地址https://gitcode.com/gh_mirrors/zeppelin2/zeppelin点击查看免费下载本文是 Apache Zeppelin 的完整安装实操指南覆盖环境要求、二进制包与源码构建两种获取方式、命令行启停、环境变量配置以及基于 upstart 的服务化管理。读完本文你将能够在 Unix 类平台与 Windows 上独立完成 Zeppelin 的安装、启动、验证与随系统自启动的部署并为后续接入 Spark、SQL、Python 等解释器做好准备。环境要求Apache Zeppelin 官方支持并在以下环境中做过测试名称要求Oracle JDK1.7 及以上需设置JAVA_HOME环境变量操作系统Mac OSX、Ubuntu 14.X、CentOS 6.X、Windows 7 Pro SP1在启动脚本中JAVA_HOME是否被设置会直接影响运行方式。bin/common.sh 中可以看到若设置了JAVA_HOME则使用${JAVA_HOME}/bin/java作为 JVM 启动器否则回退到PATH中的java命令。因此建议在启动前显式导出JAVA_HOME避免因 JVM 版本不一致导致运行异常。获取 Zeppelin二进制包还是源码构建下载二进制包Zeppelin 官方提供两种二进制包二者唯一的区别在于是否内置了解释器all interpreter package全量解释器包解压到你选择的任意目录即可直接使用所有解释器已经随包附带net-install interpreter package网络安装解释器包解压后需要按 安装附加解释器 的说明自行安装解释器。如果拿不定主意直接运行./bin/install-interpreter.sh --all安装全部解释器即可。bin/install-interpreter.sh实际上是一个 Java 启动包装脚本它通过org.apache.zeppelin.interpreter.install.InstallInterpreter主类见 InstallInterpreter.java从 Maven 仓库拉取解释器构件。哪些解释器可以安装、对应哪个 Maven artifact由 conf/interpreter-list 定义例如# [name] [maven artifact] [description] alluxio org.apache.zeppelin:zeppelin-alluxio:0.8.0 Alluxio interpreter angular org.apache.zeppelin:zeppelin-angular:0.8.0 HTML and AngularJS view rendering beam org.apache.zeppelin:zeppelin-beam:0.8.0 Beam interpreter bigquery org.apache.zeppelin:zeppelin-bigquery:0.8.0 BigQuery interpreter cassandra org.apache.zeppelin:zeppelin-cassandra_2.11:0.8.0 Cassandra interpreter built with Scala 2.11 elasticsearch org.apache.zeppelin:zeppelin-elasticsearch:0.8.0 Elasticsearch interpreter file org.apache.zeppelin:zeppelin-file:0.8.0 HDFS file interpreter flink org.apache.zeppelin:zeppelin-flink_2.11:0.8.0 Flink interpreter built with Scala 2.11 hbase org.apache.zeppelin:zeppelin-hbase:0.8.0 Hbase interpreter ignite org.apache.zeppelin:zeppelin-ignite_2.11:0.8.0 Ignite interpreter built with Scala 2.11 jdbc org.apache.zeppelin:zeppelin-jdbc:0.8.0 Jdbc interpreter kylin org.apache.zeppelin:zeppelin-kylin:0.8.0 Kylin interpreter lens org.apache.zeppelin:zeppelin-lens:0.8.0 Lens interpreter livy org.apache.zeppelin:zeppelin-livy:0.8.0 Livy interpreter md org.apache.zeppelin:zeppelin-markdown:0.8.0 Markdown support pig org.apache.zeppelin:zeppelin-pig:0.8.0 Pig interpreter python org.apache.zeppelin:zeppelin-python:0.8.0 Python interpreter scio org.apache.zeppelin:zeppelin-scio_2.11:0.8.0 Scio interpreter shell org.apache.zeppelin:zeppelin-shell:0.8.0 Shell command可以看出net-install 包的可安装解释器覆盖了 Spark、SQL 生态之外的绝大多数场景Spark 相关解释器默认内置在二进制包中。该文件的单元测试见 InstallInterpreterTest.java可用于了解安装逻辑的校验流程。从源码构建如果你希望基于源码自行构建请参照 如何构建 Zeppelin 的完整说明。源码构建产物zeppelin-server/target/classes等目录会被启动脚本自动识别并加入 classpath这在 bin/zeppelin-daemon.sh 中可以看到脚本会优先加载本地构建出的zeppelin-interpreter、zeppelin-zengine、zeppelin-server的target/classes同时也会扫描lib、lib/interpreter等目录下的 jar。从命令行启动与停止 ZeppelinUnix 类平台使用守护进程脚本在所有 Unix 类平台Mac OSX、Linux 等上后台启动 Zeppelinbin/zeppelin-daemon.sh start启动成功后用浏览器访问 http://localhost:8080 即可进入 Zeppelin 界面。停止服务bin/zeppelin-daemon.sh stopbin/zeppelin-daemon.sh还支持更多子命令见 bin/zeppelin-daemon.sh子命令作用start以 nohup 方式后台启动写入 PID 文件stop优雅停止进程最长等待 40 秒超时强制kill -9restart先 stop 再 startreload与 restart 相同先 stop 再 startstatus检查进程是否存活upstart以服务模式前台运行供服务管理器调用-v/--version打印 Zeppelin 版本脚本默认运行的主类是org.apache.zeppelin.server.ZeppelinServer。其运行细节包括PID 文件位于${ZEPPELIN_PID_DIR}/zeppelin-${ZEPPELIN_IDENT_STRING}-${HOSTNAME}.pidZEPPELIN_PID_DIR默认为${ZEPPELIN_HOME}/runZEPPELIN_IDENT_STRING默认为当前系统用户名见 bin/common.sh 与 bin/zeppelin-daemon.sh日志写入${ZEPPELIN_LOG_DIR}/zeppelin-${ZEPPELIN_IDENT_STRING}-${HOSTNAME}.logZEPPELIN_LOG_DIR默认为${ZEPPELIN_HOME}/logs启动时若日志目录或 PID 目录不存在会自动创建initialize_default_directories启动后脚本会sleep 2并检查进程是否存活check_if_process_is_alive若进程死亡会打印日志尾部便于排查支持通过--config conf-dir指定自定义配置目录例如bin/zeppelin-daemon.sh --config /etc/zeppelin/conf start。如果希望在前台运行便于直接观察控制台输出、调试启动问题可以使用bin/zeppelin.shbin/zeppelin.sh通过exec直接前台运行ZeppelinServer见 bin/zeppelin.sh不写 PID 文件适合调试或 CI 场景。Windows使用 zeppelin.cmd如果你在 Windows 上bin\zeppelin.cmd该脚本用于前台启动 Zeppelin启动完成后同样访问 http://localhost:8080。常用环境变量配置Zeppelin 的所有运行参数都可以通过环境变量注入。将 conf/zeppelin-env.sh.template 复制为conf/zeppelin-env.sh后取消对应行的注释即可生效bin/common.sh 会在启动时自动加载$ZEPPELIN_CONF_DIR/zeppelin-env.sh。常用变量如下环境变量默认值说明JAVA_HOME无JDK 安装路径决定使用哪个java启动器ZEPPELIN_ADDR127.0.0.1绑定地址需对外提供服务时改为0.0.0.0ZEPPELIN_PORT8080Web 服务监听端口ZEPPELIN_JAVA_OPTS空附加 JVM 选项如-Dspark.executor.memory8gZEPPELIN_MEM-Xms1024m -Xmx1024m -XX:MaxPermSize512mZeppelin 服务进程 JVM 内存ZEPPELIN_INTP_MEM-Xms1024m -Xmx1024m -XX:MaxPermSize512m解释器进程 JVM 内存ZEPPELIN_INTP_JAVA_OPTS空解释器进程附加 JVM 选项ZEPPELIN_SSL_PORT空启用 SSL 时使用的端口ZEPPELIN_JMX_ENABLE/ZEPPELIN_JMX_PORTfalse/9996是否开启 JMX 及端口ZEPPELIN_LOG_DIR${ZEPPELIN_HOME}/logs日志目录ZEPPELIN_PID_DIR${ZEPPELIN_HOME}/runPID 文件目录ZEPPELIN_NOTEBOOK_DIR无Notebook 存储目录ZEPPELIN_NOTEBOOK_HOMESCREEN无首页展示的 notebook id如2A94M5J1ZSPARK_HOME无设置后使用外部 Spark 安装spark-submit 方式运行 Spark 解释器HADOOP_CONF_DIR无设置后其目录会被加入 classpathYARN client 模式读取 yarn-site.xml其中ZEPPELIN_MEM/ZEPPELIN_INTP_MEM的默认值在 bin/common.sh 中定义ZEPPELIN_PORT与ZEPPELIN_ADDR等参数最终由服务端配置读取并用于启动 Jetty 容器相关配置项可参见 配置指南。使用服务管理器upstart将 Zeppelin 作为系统服务运行Zeppelin 可以被系统服务管理器如 upstart自动拉起实现开机自启与崩溃重启。以下说明基于 Ubuntu 编写。首先在/etc/init/zeppelin.conf保存如下 upstart 脚本description zeppelin start on (local-filesystems and net-device-up IFACE!lo) stop on shutdown # Respawn the process on unexpected termination respawn # respawn the job up to 7 times within a 5 second period. # If the job exceeds these values, it will be stopped and marked as failed. respawn limit 7 5 # zeppelin was installed in /usr/share/zeppelin in this example chdir /usr/share/zeppelin exec bin/zeppelin-daemon.sh upstart配置要点说明start on (local-filesystems and net-device-up IFACE!lo)在本地文件系统就绪且非回环网卡联网后启动服务respawnrespawn limit 7 5进程意外终止时自动重启5 秒内最多重启 7 次超过则标记为失败并停止chdir必须指向你的 Zeppelin 安装目录示例中为/usr/share/zeppelin请按实际解压路径修改exec bin/zeppelin-daemon.sh upstart以 upstart 模式运行守护脚本。该模式在 bin/zeppelin-daemon.sh 中实现与start不同它不进行nohup后台化而是前台运行 Java 进程将标准输出追加到${ZEPPELIN_OUTFILE}从而把进程生命周期完全交给服务管理器接管。保存后即可用标准的 service 命令管理 Zeppelinsudo service zeppelin start sudo service zeppelin stop sudo service zeppelin restart其他服务管理器如 systemd也可采用类似思路把upstart参数透传给zeppelin-daemon.sh即可bin/zeppelin-daemon.sh upstart验证安装与后续步骤启动完成后打开 http://localhost:8080看到 Zeppelin 首页即表示安装成功。接下来可按需深入熟悉界面先阅读 探索 Zeppelin UI了解 Notebook、Paragraph 与解释器绑定等核心概念跑通首个 Notebook在浏览器中打开内置的 Tutorial Notebook仓库中的对应笔记文件见 notebook/2A94M5J1Z/note.json体验完整的数据分析流程调整配置参考 配置指南 修改端口号、绑定地址等参数也可直接通过conf/zeppelin-env.sh注入环境变量接入计算引擎Zeppelin 中的 Spark 支持与 Apache Spark 深度集成Zeppelin 中的 SQL 支持Zeppelin 中的 Python 支持含 Matplotlib、Pandas、Conda/Docker 集成更多可用解释器见各解释器模块目录如 flink、jdbc、livy、python 等多用户支持如需部署为多人使用环境请查看 多用户支持。至此Apache Zeppelin 已完成安装、启动与必要的服务化管理配置可以进入 Notebook 交互式数据分析的实际使用阶段。赞分享后端前端大数据数据分析【免费下载链接】zeppelinWeb-based notebook that enables>项目地址https://gitcode.com/gh_mirrors/zeppelin2/zeppelin点击查看免费下载相关推荐Apache Zeppelin 安装与启动完全指南从二进制包、源码构建到 Docker 与服务化管理Apache Zeppelin 安装与启动完全指南从二进制包、源码构建到 Docker 与服务化管理 Apache Zeppelin 是一款 Web 端的数据数据分析数据可视化大数据后端Apache Zeppelin 安装与启动全指南二进制包、命令行、Docker 与服务化管理Apache Zeppelin 安装与启动全指南二进制包、命令行、Docker 与服务化管理 Apache Zeppelin 是一个基于 Web 的笔记本式数数据分析数据可视化大数据后端前端任务调度kitty 终端快速上手指南二进制安装、包管理器部署与从源码构建kitty 终端快速上手指南二进制安装、包管理器部署与从源码构建 本篇指南以 kitty 官方文档 docs/quickstart.rst https://l桌面应用上一篇终极ESP32物联网开发指南从零构建智能设备的完整教程下一篇ReactPy中的国际化翻译工作流工具比较不同工具功能创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考