feat: align mlebench data and evaluation & several fix on kaggle workflow (#477)

* several improvement on kaggle loop

* small refinement on prompt

* fix bugs

* add the score of each model in every experiment

* fix ci error

* fix error in ventilator tpl

* fix CI

---------

Co-authored-by: Xu Yang <xuyang1@microsoft.com>
Co-authored-by: Bowen Xian <xianbowen@outlook.com>
Co-authored-by: WinstonLiye <1957922024@qq.com>
Co-authored-by: TPLin22 <tplin2@163.com>
This commit is contained in:
Xu Yang
2024-11-15 15:40:22 +08:00
committed by GitHub
parent 21ee8b635b
commit 6809154ed7
25 changed files with 364 additions and 209 deletions
@@ -283,7 +283,10 @@ class ModelCoderEvaluator(Evaluator):
else:
gt_np_array = None
shape_feedback, shape_decision = shape_evaluator(gen_np_array, (batch_size, 1))
shape_feedback, shape_decision = shape_evaluator(
gen_np_array,
(batch_size, self.scen.model_output_channel if hasattr(self.scen, "model_output_channel") else 1),
)
value_feedback, value_decision = value_evaluator(gen_np_array, gt_np_array)
code_feedback, _ = ModelCodeEvaluator(scen=self.scen).evaluate(
target_task=target_task,