imwemans commited on
Commit
3348b20
Β·
1 Parent(s): fe41b50

added plots to separate tab

Browse files
Files changed (1) hide show
  1. app.py +24 -22
app.py CHANGED
@@ -27,7 +27,7 @@ try:
27
  LEADERBOARD_DF = get_leaderboard_df_from_hf_dataset(EVAL_RESULTS_PATH)
28
  LEADERBOARD_DF = summarize_model_task_type_performance(LEADERBOARD_DF)
29
  LEADERBOARD_DF = prepare_leaderboard_df(LEADERBOARD_DF)
30
-
31
  wrapped_task_plot = make_plot_wrapper(leaderboard_df=LEADERBOARD_DF, group_by="Model", filter_col="Task", orientation="h")
32
  wrapped_model_plot = make_plot_wrapper(leaderboard_df=LEADERBOARD_DF, group_by="Task", filter_col="Model", orientation="v")
33
 
@@ -74,39 +74,41 @@ with demo:
74
  gr.Markdown(INTRODUCTION_TEXT, elem_classes="markdown-text")
75
 
76
  with gr.Tabs(elem_classes="tab-buttons") as tabs:
77
- with gr.TabItem("πŸ… LLM Benchmark", elem_id="llm-benchmark-tab-table", id=0):
78
  leaderboard = init_leaderboard(LEADERBOARD_DF)
79
 
80
- with gr.Accordion("🧬 Overview of Performance for a Specific Task", open=False):
81
- gr.Markdown("Visualize model performance for a specific task and metric")
 
 
 
82
 
83
- task_choices = sorted(LEADERBOARD_DF["Task"].dropna().unique())
84
 
85
- with gr.Row():
86
- task_dropdown = gr.Dropdown(choices=task_choices, label="Select Task")
87
- metric_dropdown = gr.Dropdown(choices=METRICS_FOR_PLOTS, value="Accuracy", label="Select Metric")
88
-
89
- performance_plot = gr.Plot()
90
 
91
- task_dropdown.change(fn=wrapped_task_plot, inputs=[task_dropdown, metric_dropdown], outputs=performance_plot)
92
- metric_dropdown.change(fn=wrapped_task_plot, inputs=[task_dropdown, metric_dropdown], outputs=performance_plot)
93
 
 
 
94
 
95
- with gr.Accordion("πŸ€– Overview of Performance for a Specific Model", open=False):
96
- gr.Markdown("Visualize model performance across tasks according to a specific metric")
97
 
98
- model_choices = sorted(LEADERBOARD_DF["Model"].dropna().unique())
99
 
100
- with gr.Row():
101
- model_dropdown = gr.Dropdown(choices=model_choices, label="Select Model")
102
- metric2_dropdown = gr.Dropdown(choices=METRICS_FOR_PLOTS, value="Accuracy", label="Select Metric")
103
 
104
- model_plot = gr.Plot()
105
 
106
- model_dropdown.change(fn=wrapped_model_plot, inputs=[model_dropdown, metric2_dropdown], outputs=model_plot)
107
- metric2_dropdown.change(fn=wrapped_model_plot, inputs=[model_dropdown, metric2_dropdown], outputs=model_plot)
108
 
109
- with gr.TabItem("πŸ“ About", elem_id="llm-benchmark-tab-table", id=2):
110
  gr.Markdown(LLM_BENCHMARKS_TEXT, elem_classes="markdown-text")
111
 
112
  with gr.Row():
 
27
  LEADERBOARD_DF = get_leaderboard_df_from_hf_dataset(EVAL_RESULTS_PATH)
28
  LEADERBOARD_DF = summarize_model_task_type_performance(LEADERBOARD_DF)
29
  LEADERBOARD_DF = prepare_leaderboard_df(LEADERBOARD_DF)
30
+
31
  wrapped_task_plot = make_plot_wrapper(leaderboard_df=LEADERBOARD_DF, group_by="Model", filter_col="Task", orientation="h")
32
  wrapped_model_plot = make_plot_wrapper(leaderboard_df=LEADERBOARD_DF, group_by="Task", filter_col="Model", orientation="v")
33
 
 
74
  gr.Markdown(INTRODUCTION_TEXT, elem_classes="markdown-text")
75
 
76
  with gr.Tabs(elem_classes="tab-buttons") as tabs:
77
+ with gr.TabItem("πŸ… LLM Leaderboard", elem_id="llm-benchmark-tab-table", id=0):
78
  leaderboard = init_leaderboard(LEADERBOARD_DF)
79
 
80
+ with gr.TabItem("πŸ“Š Performance Plots", elem_id="llm-benchmark-performance-plots", id=1):
81
+ with gr.TabItem("πŸ“Š Performance Plots", elem_id="llm-benchmark-tab-table", id=2):
82
+
83
+ with gr.Accordion("🧬 Overview of Performance for a Specific Task", open=False):
84
+ gr.Markdown("Visualize model performance for a specific task and metric")
85
 
86
+ task_choices = sorted(LEADERBOARD_DF["Task"].dropna().unique())
87
 
88
+ with gr.Row():
89
+ task_dropdown = gr.Dropdown(choices=task_choices, label="Select Task")
90
+ metric_dropdown = gr.Dropdown(choices=METRICS_FOR_PLOTS, value="Accuracy", label="Select Metric")
 
 
91
 
92
+ performance_plot = gr.Plot()
 
93
 
94
+ task_dropdown.change(fn=wrapped_task_plot, inputs=[task_dropdown, metric_dropdown], outputs=performance_plot)
95
+ metric_dropdown.change(fn=wrapped_task_plot, inputs=[task_dropdown, metric_dropdown], outputs=performance_plot)
96
 
97
+ with gr.Accordion("πŸ€– Overview of Performance for a Specific Model", open=False):
98
+ gr.Markdown("Visualize model performance across tasks according to a specific metric")
99
 
100
+ model_choices = sorted(LEADERBOARD_DF["Model"].dropna().unique())
101
 
102
+ with gr.Row():
103
+ model_dropdown = gr.Dropdown(choices=model_choices, label="Select Model")
104
+ metric2_dropdown = gr.Dropdown(choices=METRICS_FOR_PLOTS, value="Accuracy", label="Select Metric")
105
 
106
+ model_plot = gr.Plot()
107
 
108
+ model_dropdown.change(fn=wrapped_model_plot, inputs=[model_dropdown, metric2_dropdown], outputs=model_plot)
109
+ metric2_dropdown.change(fn=wrapped_model_plot, inputs=[model_dropdown, metric2_dropdown], outputs=model_plot)
110
 
111
+ with gr.TabItem("πŸ“ About", elem_id="llm-benchmark-about", id=2):
112
  gr.Markdown(LLM_BENCHMARKS_TEXT, elem_classes="markdown-text")
113
 
114
  with gr.Row():